聯繫我們
 課程時長 14 時間: (2 天)

課程簡介

語音合成與語音複製簡介

  • 文字轉語音(TTS)與神經語音合成的概述
  • 語音複製 vs. 語音生成:使用場景與界限
  • 關鍵模型:Tacotron、WaveNet、FastSpeech、VITS

使用商業平台

  • 使用ElevenLabs和Resemble AI
  • 語音創建、複製與編輯
  • API存取與文字轉語音工作流程

使用開放原始碼工具建構

  • 安裝與設定Coqui TTS
  • 訓練自定義語音並管理數據集
  • 生成具有精細控制(音高、速度、情緒)的語音

數據準備與語音數據集管理

  • 收集與清理語音樣本
  • 分割、標註並對齊轉錄稿
  • 道德來源與語音同意權

應用程式整合

  • 將TTS嵌入網站與應用程式
  • 建立IVR系統與互動式機器人流
  • 為影片與遊戲生成合成對話

評估品質與真實感

  • MOS(平均意見分數)與可懂度測試
  • 控制表現力與語調(Prosody)
  • 比較延遲、保真度與真實感

道德、法律與治理考量

  • Deepfake風險與責任使用
  • 同意權、歸屬權與版權影響
  • 法規與組織政策

總結與後續步驟

最低要求

  • 具備機器學習基礎知識
  • 熟悉音訊檔案格式與編輯工具
  • 具備基本的Python程式設計技能

目標受眾

  • 對語音合成有興趣的AI開發人員與工程師
  • 探索語音生成的內容創作者與媒體技術人員
  • 建構個人化或動態音訊系統的研发團隊

人數


每位參與者的報價

即將到來的課程

課程分類