感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 21 時間: (3 天)
課程簡介
音訊分類基礎
- 聲音事件類型:環境聲、機械聲、人聲
- 使用案例概觀:監控、警報、自動化
- 音訊分類、偵測與分割之比較
音訊資料與特徵提取
- 音訊檔案類型與格式
- 採樣率、窗口化及幀大小之考量
- 提取 MFCC、色度特徵及梅爾頻譜
資料準備與標註
- UrbanSound8K、ESC-50 及自訂資料集
- 標註聲音事件及時間邊界
- 資料集平衡與音訊增強
建構音訊分類模型
- 使用卷積神經網路 (CNN) 進行音訊處理
- 模型輸入:原始波形 vs. 特徵向量
- 損失函數、評估指標及過擬合問題
事件偵測與時間定位
- 基於幀與基於片段的偵測策略
- 使用閾值與平滑技術進行偵測結果後處理
- 在音訊時間軸上視覺化預測結果
進階主題與即時處理
- 在低資料量場景中應用遷移學習
- 使用 TensorFlow Lite 或 ONNX 部署模型
- 串流音訊處理及延遲考量
專案開發與應用情境
- 設計完整管線:從資料攝取到分類
- 為監控、品質控制或警報系統開發概念驗證 (PoC)
- 記錄日誌、設定警報及與儀表板或 API 整合
總結與後續步驟
最低要求
- 理解機器學習概念與模型訓練流程
- 具備 Python 程式設計及資料前處理經驗
- 熟悉數位音訊基礎知識
受眾對象
- 資料科學家
- 機器學習工程師
- 音訊訊號處理領域的研究者與開發人員