聯繫我們

課程簡介

簡介

本節提供關於何時使用「機器學習」的總覽,介紹相關考量事項及其含義,包括優缺點。內容涵蓋數據類型(結構化/非結構化/靜態/流式)、數據有效性/規模、數據驅動 vs. 用戶驅動分析、統計模型 vs. 機器學習模型/非監督學習的挑戰、偏差-方差取捨、迭代/評估、交叉驗證方法、有監督/無監督/強化學習。

主要主題

1. 理解 Naive Bayes

  • 貝葉斯方法的基本概念
  • 機率
  • 聯合機率
  • 貝葉斯定理的條件機率
  • Naive Bayes 演算法
  • Naive Bayes 分類
  • 拉普拉斯估計量
  • 使用數值特徵進行 Naive Bayes

2. 理解決策樹

  • 分而治之
  • C5.0 決策樹演算法
  • 選擇最佳分割點
  • 修剪決策樹

3. 理解神經網路

  • 從生物神經元到人工神經元
  • 激活函數
  • 網路拓撲結構
  • 層數
  • 信息傳遞方向
  • 每層的節點數
  • 使用反向傳播訓練神經網路
  • 深度學習

4. 理解支援向量機 (SVM)

  • 使用超平面進行分類
  • 尋找最大邊界間隔
  • 線性可分數據的情況
  • 非線性可分數據的情況
  • 使用核函數處理非線性空間

5. 理解叢集

  • 作為機器學習任務的叢集
  • 用於叢集的 K-means 演算法
  • 使用距離分配及更新叢集
  • 選擇適當的叢集數量

6. 測量分類績效

  • 處理分類預測數據
  • 深入探討混淆矩陣
  • 使用混淆矩陣測量績效
  • 超越準確率 – 其他績效指標
  • Kappa 統計量
  • 敏感度與特異度
  • 精確率與召回率
  • F 分數
  • 視覺化績效取捨
  • ROC 曲線
  • 估計未來績效
  • 保留集方法 (Holdout method)
  • 交叉驗證
  • Bootstrap 抽樣

7. 調優標準模型以提升績效

  • 使用 Caret 進行自動參數調整
  • 創建簡單調整模型
  • 自定義調整過程
  • 使用元學習改進模型績效
  • 理解集成方法
  • 裝袋 (Bagging)
  • 提升 (Boosting)
  • 隨機森林
  • 訓練隨機森林
  • 評估隨機森林績效

次要主題

8. 理解使用最近鄰的分類

  • KNN 演算法
  • 計算距離
  • 選擇適當的 k
  • 準備數據以配合 KNN 使用
  • 為什麼 KNN 演算法是惰性的?

9. 理解分類規則

  • 分離與統治 (Separate and conquer)
  • One Rule 演算法
  • RIPPER 演算法
  • 源自決策樹的規則

10. 理解回歸

  • 簡單線性回歸
  • 普通最小二乘估計
  • 相關性
  • 多重線性回歸

11. 理解回歸樹及模型樹

  • 將回歸加入樹中

12. 理解關聯規則

  • 用於關聯規則學習的 Apriori 演算法
  • 測量規則興趣 – 支持度與信心度
  • 使用 Apriori 原理建立規則集

進階選修

  • Spark/PySpark/MLlib 及多臂帶問題 (Multi-armed bandits)

最低要求

Python 知識

 21 小時

人數


每位參與者的報價

客戶評論 (7)

即將到來的課程

課程分類