感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間: (2 天)
課程簡介
語音合成與語音複製簡介
- 文字轉語音(TTS)與神經語音合成的概述
- 語音複製 vs. 語音生成:使用場景與界限
- 關鍵模型:Tacotron、WaveNet、FastSpeech、VITS
使用商業平台
- 使用ElevenLabs和Resemble AI
- 語音創建、複製與編輯
- API存取與文字轉語音工作流程
使用開放原始碼工具建構
- 安裝與設定Coqui TTS
- 訓練自定義語音並管理數據集
- 生成具有精細控制(音高、速度、情緒)的語音
數據準備與語音數據集管理
- 收集與清理語音樣本
- 分割、標註並對齊轉錄稿
- 道德來源與語音同意權
應用程式整合
- 將TTS嵌入網站與應用程式
- 建立IVR系統與互動式機器人流
- 為影片與遊戲生成合成對話
評估品質與真實感
- MOS(平均意見分數)與可懂度測試
- 控制表現力與語調(Prosody)
- 比較延遲、保真度與真實感
道德、法律與治理考量
- Deepfake風險與責任使用
- 同意權、歸屬權與版權影響
- 法規與組織政策
總結與後續步驟
最低要求
- 具備機器學習基礎知識
- 熟悉音訊檔案格式與編輯工具
- 具備基本的Python程式設計技能
目標受眾
- 對語音合成有興趣的AI開發人員與工程師
- 探索語音生成的內容創作者與媒體技術人員
- 建構個人化或動態音訊系統的研发團隊