聯繫我們

課程簡介

機器學習簡介

  • 機器學習的類型 – 監督式 vs. 非監督式
  • 從統計學習到機器學習
  • 資料探勘工作流程:商業理解、資料準備、建模、部署
  • 選擇合適的演算法
  • 過度擬合與偏差-變異數權衡

Python 和 ML 庫概述

  • 為什麼要使用程式語言進行機器學習
  • 在 R 和 Python 之間做選擇
  • Python 快速入門和 Jupyter Notebooks
  • Python 庫:pandas、NumPy、scikit-learn、matplotlib、seaborn

測試和評估機器學習演算法

  • 泛化、過度擬合和模型驗證
  • 評估策略:保留法、交叉驗證、自助法
  • 回歸指標:ME、MSE、RMSE、MAPE
  • 分類指標:準確率、混淆矩陣、不平衡類別
  • 模型效能可視化:利潤曲線、ROC 曲線、提升曲線
  • 模型選擇和網格搜尋進行調參

資料準備

  • 資料的導入與儲存(Python)
  • 探索性分析和摘要統計
  • 處理缺失值和異常值
  • 標準化、正規化和變換
  • 定性數據重新編碼和使用 pandas 進行資料整理

分類演算法

  • 二元分類與多類分類
  • 邏輯迴歸與判別函數
  • 貝葉斯分類器、k-近鄰演算法
  • 決策樹:CART、隨機森林、Bagging、Boosting、XGBoost
  • 支援向量機及其核函數
  • 集成學習技術

回歸與數值預測

  • 最小二乘法和變量選擇
  • 正則化方法:L1、L2
  • 多項式迴歸和非線性模型
  • 回歸樹和樣條函數

非監督式學習

  • 聚類技術:k-means、k-medoids、層次聚類、SOMs
  • 維度降減:PCA、因子分析、SVD
  • 多維刻度法

文本探勘

  • 文本預處理和分詞
  • 袋之詞模型、詞幹提取和詞形歸併
  • 情感分析和詞頻統計
  • 使用詞雲可視化文本數據

推薦系統

  • 基於使用者和基於物品的協同過濾
  • 設計和評估推薦引擎

關聯規則探勘

  • 頻繁項集和 Apriori 演算法
  • 市場籃子分析和提升比率

異常值檢測

  • 極端值分析
  • 基於距離和密度的方法
  • 高維數據中的異常值檢測

機器學習案例研究

  • 理解商業問題
  • 資料預處理和特徵工程
  • 模型選擇和參數調優
  • 評估和結果展示
  • 部署

總結與下一步

最低要求

  • 對統計學和線性代數有基本了解
  • 熟悉資料分析或商業智慧概念
  • 建議具備一些程式設計經驗(最好是 Python 或 R)
  • 對學習應用機器學習以推動資料驅動專案有興趣

受眾

  • 資料分析師和科學家
  • 統計學家和研究專業人士
  • 探索機器學習工具的開發人員和 IT 專業人士
  • 任何參與資料科學或預測分析專案的人士
 21 小時

人數


每位參與者的報價

客戶評論 (3)

即將到來的課程

課程分類