聯繫我們

課程簡介

強化學習介紹

  • 強化學習及其應用概覽。
  • 監督式學習、非監督式學習與強化學習之間的差異。
  • 關鍵概念:Agent、環境、獎勵和策略。

馬可夫決策過程 (MDPs)

  • 理解狀態、動作、獎勵及狀態轉換。
  • 價值函數與 Bellman 方程式。
  • 用於解決 MDPs 的動態規劃。

核心 RL 演算法

  • 表格型方法:Q-Learning 和 SARSA。
  • 基於策略的方法:REINFORCE 演算法。
  • Actor-Critic 架構及其應用。

深度強化學習

  • 深度 Q-網路 (DQN) 介紹。
  • 經驗回放與目標網路。
  • 策略梯度及進階深度 RL 方法。

RL 框架與工具

  • OpenAI Gym 及其他 RL 環境介紹。
  • 使用 PyTorch 或 TensorFlow 開發 RL 模型。
  • RL Agent 的訓練、測試與基準測試。

RL 中的挑戰

  • 在訓練中平衡探索與開發。
  • 處理稀疏獎勵和信譽分配問題。
  • RL 的可擴展性與運算挑戰。

實作活動

  • 從零實現 Q-Learning 和 SARSA 演算法。
  • 在 OpenAI Gym 中訓練基於 DQN 的 Agent 遊玩簡單遊戲。
  • 微調 RL 模型以提升自訂環境中的效能。

總結與後續步驟

最低要求

  • 對機器學習原理和演算法有深入的理解。
  • 精通 Python 程式設計。
  • 熟悉神經網路及深度學習框架。

適用對象

  • 機器學習工程師。
  • AI 專家。
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類