聯繫我們

課程簡介

強化學習與 Agent AI 簡介

  • 不確定性下的決策制定和序列規劃
  • RL 的關鍵組件:Agents、環境、狀態和獎勵
  • RL 在適應性和 Agent AI 系統中的作用

馬爾可夫決策過程 (MDPs)

  • MDPs 的正式定義和屬性
  • 值函數、Bellman 方程和動態規劃
  • 策略評估、改進和迭代

模型無關強化學習 (Model-Free Reinforcement Learning)

  • 蒙特卡洛和時差分 (TD) 學習
  • Q-learning 和 SARSA
  • 實戰:在 Python 中實現表格 RL 方法

深度強化學習 (Deep Reinforcement Learning)

  • 結合神經網絡與 RL 進行函數逼近
  • Deep Q-Networks (DQN) 和經驗回放
  • Actor-Critic 架構和策略梯度
  • 實戰:使用 DQN 和 PPO 以及 Stable-Baselines3 訓練 Agent

探索策略和獎勵塑形 (Reward Shaping)

  • 平衡探索與開發 (ε-greedy、UCB、熵方法)
  • 設計獎勵函數並避免非預期行為
  • 獎勵塑形和課程學習

RL 與決策制定的高級主題

  • 多 Agent 強化學習和合作策略
  • 分層強化學習和選項框架
  • 離線 RL 和模仿學習以實現更安全的部署

模擬環境與評估

  • 使用 OpenAI Gym 和自定義環境
  • 連續 vs. 離散動作空間
  • Agent 性能、穩定性和樣本效率的指標

將 RL 整合到 Agent AI 系統中

  • 在混合 Agent 架構中結合推理與 RL
  • 將強化學習與使用工具的 Agents 整合
  • 擴展和部署的運營考量

最終項目

  • 為模擬任務設計並實現強化學習 Agent
  • 分析訓練性能並優化超參數
  • 在 Agent 環境中展示適應性行為和決策制定能力

總結與下一步

最低要求

  • 強大的 Python 編程能力
  • 對機器學習和深度學習概念的紮實理解
  • 熟悉線性代數、概率論和基本優化方法

對象

  • 強化學習工程師和應用 AI 研究員
  • 機器人和自動化開發者
  • 致力於適應性和 Agent AI 系統的工程團隊
 28 小時

人數


每位參與者的報價

客戶評論 (3)

即將到來的課程

課程分類