聯繫我們

課程簡介

多模態 AI 導論

  • 何謂多模態 AI?
  • 關鍵挑戰與應用場景
  • 領先多模態模型概覽

文字處理與自然語言理解

  • 利用大型語言模型(LLM)建構基於文字的 AI 代理
  • 理解多模態任務的提示工程(Prompt Engineering)
  • 針對特定領域應用微調文字模型

圖像識別與生成

  • 利用 AI 處理圖像:分類、標註與物件偵測
  • 使用擴散模型(Diffusion Models)生成圖像(如 Stable Diffusion、DALLE)
  • 將圖像資料整合至基於文字的模型中

語音與音訊處理

  • 使用 Whisper ASR 進行語音識別
  • 文字轉語音(TTS)合成技術
  • 強化基於語音的 AI 互動體驗

整合多模態輸入

  • 建構處理多種輸入類型的 AI 管線
  • 結合文字、圖像與語音資料的融合技術
  • 多模態 AI 代理的實際應用案例

部署多模態 AI 代理

  • 建構基於 API 的多模態 AI 解決方案
  • 最佳化模型效能與擴展性
  • 多模態 AI 生產環境部署的最佳實踐

倫理考量與未來趨勢

  • 多模態 AI 中的偏見與公平性問題
  • 多模態資料的隱私疑慮
  • 多模態 AI 的未來發展

總結與後續步驟

最低要求

  • 理解機器學習基礎原理
  • 具備 Python 程式設計經驗
  • 熟悉深度學習框架(如 TensorFlow、PyTorch)

受訓對象

  • AI 開發者
  • 研究者
  • 多媒體工程師
 21 小時

人數


每位參與者的報價

即將到來的課程

課程分類