聯繫我們
 課程時長 21 時間:

課程簡介

多模態 AI 與 Ollama 簡介

  • 多模態學習概覽
  • 視覺-語言整合的關鍵挑戰
  • Ollama 的能力與架構

設定 Ollama 環境

  • 安裝與配置 Ollama
  • 本地模型部署操作
  • 將 Ollama 與 Python 及 Jupyter 整合

處理多模態輸入

  • 文本與圖像整合
  • 納入音頻及結構化數據
  • 設計預處理管線

文件理解應用

  • 從 PDF 和圖像中提取結構化信息
  • 將 OCR 與語言模型結合
  • 構建智能文件分析工作流

視覺問答 (VQA)

  • 設定 VQA 數據集與基準
  • 訓練與評估多模態模型
  • 構建交互式 VQA 應用程式

設計多模態智能體

  • 基於多模態推理的智能體設計原則
  • 整合感知、語言與行動
  • 為實際應用場景部署智能體

高級整合與優化

  • 使用 Ollama 微調多模態模型
  • 優化推理性能
  • 擴展性與部署考量

總結與後續步驟

最低要求

  • 對機器學習概念有深入的理解
  • 具有 PyTorch 或 TensorFlow 等深度學習框架的相關經驗
  • 熟悉自然語言處理(NLP)和計算機視覺(CV)

受眾群體

  • 機器學習工程師
  • AI 研究員
  • 整合視覺與文本工作流的产品開發者

人數


每位參與者的報價

即將到來的課程

課程分類