感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 21 時間:
課程簡介
多模態 AI 與 Ollama 簡介
- 多模態學習概覽
- 視覺-語言整合的關鍵挑戰
- Ollama 的能力與架構
設定 Ollama 環境
- 安裝與配置 Ollama
- 本地模型部署操作
- 將 Ollama 與 Python 及 Jupyter 整合
處理多模態輸入
- 文本與圖像整合
- 納入音頻及結構化數據
- 設計預處理管線
文件理解應用
- 從 PDF 和圖像中提取結構化信息
- 將 OCR 與語言模型結合
- 構建智能文件分析工作流
視覺問答 (VQA)
- 設定 VQA 數據集與基準
- 訓練與評估多模態模型
- 構建交互式 VQA 應用程式
設計多模態智能體
- 基於多模態推理的智能體設計原則
- 整合感知、語言與行動
- 為實際應用場景部署智能體
高級整合與優化
- 使用 Ollama 微調多模態模型
- 優化推理性能
- 擴展性與部署考量
總結與後續步驟
最低要求
- 對機器學習概念有深入的理解
- 具有 PyTorch 或 TensorFlow 等深度學習框架的相關經驗
- 熟悉自然語言處理(NLP)和計算機視覺(CV)
受眾群體
- 機器學習工程師
- AI 研究員
- 整合視覺與文本工作流的产品開發者