聯繫我們

課程簡介

強化學習簡介

  • 強化學習的概述及其應用
  • 監督學習、無監督學習和強化解學習的差異
  • 關鍵概念:智能體、環境、獎勵和策略

馬爾可夫決策過程(MDPs)

  • 理解狀態、動作、獎勵和狀態遷移
  • 價值函數和貝爾曼方程
  • 用於解決MDPs的動態規劃

核心RL演算法

  • 表格式方法:Q-Learning和SARSA
  • 基於策略的方法:REINFORCE演算法
  • Actor-Critic框架及其應用

深度強化學習

  • 深度Q-網絡(DQN)簡介
  • 經驗回放和目標網絡
  • 策略梯度和先進的深度RL方法

RL框架和工具

  • OpenAI Gym和其他RL環境簡介
  • 使用PyTorch或TensorFlow進行RL模型開發
  • 訓練、測試和基準測試RL智能體

RL中的挑戰

  • 在訓練中平衡探索和開發
  • 處理稀疏獎勵和信用分配問題
  • RL中的擴展性和計算挑戰

實作活動

  • 從頭實現Q-Learning和SARSA演算法
  • 訓練基於DQN的智能體在OpenAI Gym中進行簡單遊戲
  • 微調RL模型以在自定義環境中提升性能

總結和下一步

最低要求

  • 對機器學習原理和演算法有強勁的理解
  • 精通Python編程
  • 熟悉神經網絡和深度學習框架

受眾

  • 機器學習工程師
  • AI專家
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類