感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
Gemini 3 多模態入門
- 涵蓋文本、圖像、音訊及影片的能力
- 模型選擇與端點概覽
- 多模態推理的關鍵概念
處理文本與結構化輸入
- 文本生成的提示策略
- 元數據、上下文窗口與嵌入向量
- 基於文本的多模態任務編排
圖像理解與視覺工作流程
- 使用 Gemini 3 進行圖像分析與解讀
- 建立視覺搜尋與標註工具
- 建構圖生文與文生圖的互動功能
音訊輸入處理
- 語音識別與轉錄工作流程
- 音訊事件偵測與解讀
- 整合音訊與文本、視覺輸入
影片智能與場景分析
- 逐幀與連續影片推理
- 建立摘要與重點提取工具
- 基於影片的自動化與內容工作流程
設計多模態應用架構
- 在單一管線中結合多種輸入類型
- 延遲、成本與計算資源考量
- 可擴展多模態系統的最佳實務
多模態應用原型建構
- 動手建立多模態原型
- 透過提示工程快速迭代
- 測試並優化使用者體驗流程
部署多模態解決方案
- 部署策略與環境設定
- 監控實際運作效能
- 安全性與合規性考量
總結與後續步驟
最低要求
- 了解現代 AI 概念
- 具備 Python 或 JavaScript 開發經驗
- 熟悉 REST API
目標受眾
- 設計師
- 內容創作者
- 技術產品團隊
客戶評論 (1)
演講中的流程、氛圍與主題
Lukasz Kowalczyk - Allegro Sp. z o.o.
課程 - Google Gemini AI for Data Analysis
機器翻譯