聯繫我們

課程簡介

強化學習介紹

  • 什麼是強化學習?
  • 關鍵概念:智能體、環境、狀態、動作與獎勵
  • 強化學習面臨的挑戰

探索與利用

  • 在 RL 模型中平衡探索與利用
  • 探索策略:epsilon-greedy、softmax 等

Q-Learning 與深度 Q 網絡 (DQNs)

  • Q-learning 介紹
  • 使用 TensorFlow 實施 DQNs
  • 透過經驗回放和目標網絡優化 Q-learning

基於策略的方法

  • 策略梯度算法
  • REINFORCE 算法及其實施
  • Actor-Critic 方法

使用 OpenAI Gym

  • 在 OpenAI Gym 中設置環境
  • 在動態環境中模擬智能體
  • 評估智能體性能

高級強化學習技術

  • 多智能體強化學習
  • 深度確定性策略梯度 (DDPG)
  • 近端策略優化 (PPO)

部署強化學習模型

  • 強化學習的現實世界應用
  • 將 RL 模型整合至生產環境

總結與下一步

最低要求

  • 具備 Python 程式設計經驗
  • 對深度學習和機器學習概念有基本了解
  • 掌握強化學習中使用的算法與數學概念

目標受眾

  • 數據科學家
  • 機器學習從業人員
  • AI 研究人員
 28 小時

人數


每位參與者的報價

即將到來的課程

課程分類