聯繫我們
 課程時長 14 時間:

課程簡介

語音辨識技術概觀

  • 語音辨識的歷史與演進
  • 聲學模型、語言模型與解碼
  • 現代架構:RNN、Transformer 與 Whisper

音訊預處理與轉錄基礎

  • 處理音訊格式與取樣率
  • 音訊清洗、修剪與分段
  • 從音訊生成文字:即時與批處理對比

實作 Whisper 與其他 API

  • 安裝與使用 OpenAI Whisper
  • 呼叫雲端 API(Google、Azure)進行轉錄
  • 比較效能、延遲與成本

語言、口音與領域適應

  • 處理多種語言與口音
  • 自訂詞彙與雜訊容忍度
  • 處理法律、醫療或技術性語言

輸出格式與整合

  • 添加時間戳記、標點符號與說話者標籤
  • 匯出至文字、SRT 或 JSON 格式
  • 將轉錄內容整合至應用程式或資料庫

使用情境實作實驗室

  • 轉錄會議、訪談或 Podcast
  • 語音轉文字指令系統
  • 影片/音訊串流的即時字幕

評估、限制與倫理

  • 準確度指標與模型基準測試
  • 語音模型中的偏差與公平性
  • 隱私與合規性考量

總結與後續步驟

最低要求

  • 具備對通用 AI 與機器學習概念的理解
  • 熟悉音訊或多媒體檔案格式及相關工具

受眾對象

  • 處理語音數據的數據科學家與 AI 工程師
  • 開發轉錄類應用的軟體開發人員
  • 探索語音辨識以實現自動化的組織

人數


每位參與者的報價

即將到來的課程

課程分類