感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
多模態 AI 導論
- 何謂多模態 AI?
- 關鍵挑戰與應用場景
- 領先多模態模型概覽
文字處理與自然語言理解
- 利用大型語言模型(LLM)建構基於文字的 AI 代理
- 理解多模態任務的提示工程(Prompt Engineering)
- 針對特定領域應用微調文字模型
圖像識別與生成
- 利用 AI 處理圖像:分類、標註與物件偵測
- 使用擴散模型(Diffusion Models)生成圖像(如 Stable Diffusion、DALLE)
- 將圖像資料整合至基於文字的模型中
語音與音訊處理
- 使用 Whisper ASR 進行語音識別
- 文字轉語音(TTS)合成技術
- 強化基於語音的 AI 互動體驗
整合多模態輸入
- 建構處理多種輸入類型的 AI 管線
- 結合文字、圖像與語音資料的融合技術
- 多模態 AI 代理的實際應用案例
部署多模態 AI 代理
- 建構基於 API 的多模態 AI 解決方案
- 最佳化模型效能與擴展性
- 多模態 AI 生產環境部署的最佳實踐
倫理考量與未來趨勢
- 多模態 AI 中的偏見與公平性問題
- 多模態資料的隱私疑慮
- 多模態 AI 的未來發展
總結與後續步驟
最低要求
- 理解機器學習基礎原理
- 具備 Python 程式設計經驗
- 熟悉深度學習框架(如 TensorFlow、PyTorch)
受訓對象
- AI 開發者
- 研究者
- 多媒體工程師
21 小時