聯繫我們
 課程時長 14 時間:

課程簡介

Gemini 3 多模態入門

  • 涵蓋文本、圖像、音訊及影片的能力
  • 模型選擇與端點概覽
  • 多模態推理的關鍵概念

處理文本與結構化輸入

  • 文本生成的提示策略
  • 元數據、上下文窗口與嵌入向量
  • 基於文本的多模態任務編排

圖像理解與視覺工作流程

  • 使用 Gemini 3 進行圖像分析與解讀
  • 建立視覺搜尋與標註工具
  • 建構圖生文與文生圖的互動功能

音訊輸入處理

  • 語音識別與轉錄工作流程
  • 音訊事件偵測與解讀
  • 整合音訊與文本、視覺輸入

影片智能與場景分析

  • 逐幀與連續影片推理
  • 建立摘要與重點提取工具
  • 基於影片的自動化與內容工作流程

設計多模態應用架構

  • 在單一管線中結合多種輸入類型
  • 延遲、成本與計算資源考量
  • 可擴展多模態系統的最佳實務

多模態應用原型建構

  • 動手建立多模態原型
  • 透過提示工程快速迭代
  • 測試並優化使用者體驗流程

部署多模態解決方案

  • 部署策略與環境設定
  • 監控實際運作效能
  • 安全性與合規性考量

總結與後續步驟

最低要求

  • 了解現代 AI 概念
  • 具備 Python 或 JavaScript 開發經驗
  • 熟悉 REST API

目標受眾

  • 設計師
  • 內容創作者
  • 技術產品團隊

人數


每位參與者的報價

客戶評論 (1)

即將到來的課程

課程分類