聯繫我們

課程簡介

1. 深度強化學習簡介

  • 什麼是強化學習?
  • 監督學習、無監督學習與強化學習之間的差異
  • DRL 在 2025 年的應用(機器人、醫療、金融、物流)
  • 理解智能體與環境互動迴路

2. 強化學習基礎

  • 馬可夫決策過程(MDP)
  • 狀態、動作、獎勵、政策與價值函數
  • 探索與利用之間的權衡取捨
  • 蒙特卡洛方法與時間差分(TD)學習

3. 基本強化學習演算法的實作

  • 表格化方法:動態規劃、政策評估與迭代
  • Q-Learning 與 SARSA
  • Epsilon-greedy 探索與衰減策略
  • 使用 OpenAI Gymnasium 實作強化學習環境

4. 過渡到深度強化學習

  • 表格化方法的局限性
  • 使用神經網絡進行函數近似
  • Deep Q-Network (DQN) 架構與工作流程
  • 經驗重放(Experience replay)與目標網絡

5. 進階 DRL 演算法

  • Double DQN、Dueling DQN 與優先經驗重放
  • 策略梯度方法:REINFORCE 演算法
  • Actor-Critic 架構 (A2C, A3C)
  • 近端策略最佳化 (PPO)
  • Soft Actor-Critic (SAC)

6. 處理連續動作空間

  • 連續控制中的挑戰
  • 使用 DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. 實作工具與框架

  • 使用 Stable-Baselines3 和 Ray RLlib
  • 使用 TensorBoard 進行記錄與監控
  • DRL 模型的正規化參數調整

8. 獎勵工程與環境設計

  • 獎勵塑形(Reward shaping)與罰分平衡
  • 從模擬到真實的遷移學習概念
  • 在 Gymnasium 中創建自訂環境

9. 部分可觀測環境與泛化能力

  • 處理不完整狀態資訊 (POMDPs)
  • 使用 LSTM 和 RNN 的基於記憶的方法
  • 提升智能體的魯棒性與泛化能力

10. 博弈論與多智能體強化學習

  • 多智能體環境簡介
  • 合作與競爭
  • 應用於對抗性訓練與策略最佳化

11. 案例研究與實際應用

  • 自動駕駛模擬
  • 動態定價與金融交易策略
  • 機器人技術與工業自動化

12. 故障排除與最佳化

  • 診斷不穩定的訓練
  • 管理獎勵稀疏性與過度擬合
  • 在 GPU 和分佈式系統上擴展 DRL 模型

13. 總結與下一步

  • DRL 架構與關鍵演算法回顧
  • 產業趨勢與研究方向(例如 RLHF、混合模型)
  • 進一步的資源與閱讀材料

最低要求

  • 具備 Python 程式設計的熟練度
  • 理解微積分與線性代數
  • 具備機率論與統計學的基本知識
  • 有使用 Python 以及 NumPy 或 TensorFlow/PyTorch 建構機器學習模型的經驗

目標受眾

  • 對人工智慧與智慧系統有興趣的開發人員
  • 探索強化學習框架的數據科學家
  • 從事自主系統工作的機器學習工程師
 21 小時

人數


每位參與者的報價

客戶評論 (3)

即將到來的課程

課程分類