聯繫我們

課程簡介

Mistral 多模態模型介紹

  • Mistral Medium 與多模態能力概述
  • OCR/文件模型與應用案例
  • 整合至開源生態系統

OCR 與視覺管道

  • Mistral 模型的 OCR 基礎知識
  • 影像及掃描文件之預處理
  • 從影像中提取結構化文字

文件理解

  • 設計文件的 NLP 管道
  • 實體識別、摘要與分類
  • 文字與視覺資料之跨模態連結

搜尋與知識應用

  • 視覺-文字搜尋系統
  • 利用 OCR 輸出建構語意搜尋
  • 企業文件儲存庫

輔助與互動式應用程式

  • 多模態助手之 UI 設計
  • 無障礙應用 (例如:視覺轉文字)
  • 實際工作生產力工具

效能與最佳化

  • 擴展多模態管道
  • 推論效能微調
  • 評估準確性與效率之權衡

案例研究與未來方向

  • AI 的多模態產業應用
  • OCR 與文件 AI 的研究趨勢
  • 視覺-文字任務中之負責任 AI 考量

總結與下一步

最低要求

  • 具備自然語言處理概念之理解
  • 熟悉 Python 與 ML 框架
  • 了解電腦視覺基礎知識

受眾

  • 產品團隊
  • ML 研究人員
  • 應用 ML 工程師
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類