聯繫我們

課程簡介

Mistral 多模態模型簡介

  • Mistral Medium 及多模態能力概觀
  • OCR/文件模型及其應用案例
  • 與開放原始碼生態系統的整合

OCR 與視覺流程

  • 使用 Mistral 模型進行 OCR 基礎操作
  • 圖像與掃描文件的預處理
  • 從圖像中提取結構化文本

文件理解

  • 設計用於文件的 NLP 流程
  • 實體識別、摘要生成及分類
  • 文本與視覺數據的跨模態連結

搜尋與知識應用

  • 視覺文本搜尋系統
  • 利用 OCR 輸出建構語意搜尋
  • 企業級文件資料庫

輔助性與互動式應用

  • 多模態助理的使用者介面設計
  • 無障礙應用(例如:視覺轉文本)
  • 實際生產力工具

效能與最佳化

  • 擴展多模態流程
  • 推論效能調整
  • 評估準確率與效能的權衡

案例研究與未來趨勢

  • 多模態 AI 在產業中的應用
  • OCR 與文件 AI 的研究趨勢
  • 視覺文本任務中的負責任 AI 考量

總結與後續步驟

最低要求

  • 理解自然語言處理的基本概念
  • 具備 Python 及機器學習框架的開發經驗
  • 熟悉電腦視覺的基本原理

目標學員

  • 產品團隊
  • 機器學習研究員
  • 應用機器學習工程師
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類