聯繫我們

課程簡介

視覺語言模型簡介

  • VLMs 概覽及其在跨模態 AI 中的角色
  • 熱門架構:CLIP、Flamingo、BLIP 等
  • 應用案例:檢索、標題生成、自主系統、內容分析

準備微調環境

  • 設置 OpenCLIP 及其他 VLM 函式庫
  • 圖像-文本配對的數據集格式
  • 視覺與文本輸入的預處理流程

微調 CLIP 及類似模型

  • 對比損失與聯合嵌入空間
  • 實作:在自訂數據集上微調 CLIP
  • 處理領域特定與多語言數據

進階微調技術

  • 使用 LoRA 和基於適配器的方法以提升效率
  • Prompt tuning 與視覺 prompt 注入
  • 零樣本學習與微調評估的權衡

評估與基準測試

  • VLMs 評估指標:檢索準確率、BLEU、CIDEr、召回率
  • 視覺文本對齊診斷
  • 可視化嵌入空間與誤分類情況

部署與實際應用

  • 匯出模型以供推論 (TorchScript, ONNX)
  • 將 VLMs 整合至流程或 API 中
  • 資源考量與模型擴展

案例研究與應用場景

  • 媒體分析與內容審核
  • 電子商務與數位圖書館中的檢索與獲取
  • 機器人与自主系統中的跨模態互動

總結與後續步驟

最低要求

  • 理解視覺與 NLP 的深度學習基礎
  • 具備 PyTorch 及基於 transformer 模型的使用經驗
  • 熟悉跨模態模型架構

目標受眾

  • 計算機視覺工程師
  • AI 開發人員
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類