聯繫我們

課程簡介

來自人類反饋的強化學習 (RLHF) 簡介

  • 什麼是 RLHF 以及其重要性
  • 與監督式微調方法的比較
  • RLHF 在現代 AI 系統中的應用

使用人類反饋進行獎勵建模

  • 收集和構建人類反饋
  • 構建和訓練獎勵模型
  • 評估獎勵模型的有效性

使用近端策略優化 (PPO) 進行培訓

  • RLHF 中 PPO 算法概覽
  • 使用獎勵模型實施 PPO
  • 迭代且安全地微調模型

語言模型的實際微調

  • 為 RLHF 工作流程準備數據集
  • 手動對小型 LLM 進行 RLHF 微調
  • 挑戰和緩解策略

將 RLHF 擴展至生產系統

  • 基礎設施和計算資源考量
  • 質量保證和持續反饋循環
  • 部署和維護的最佳實踐

道德考量與偏差緩解

  • 應對人類反饋中的道德風險
  • 偏差檢測和糾正策略
  • 確保一致性和安全輸出

案例研究和實例

  • 案例研究:使用 RLHF 微調 ChatGPT
  • 其他成功的 RLHF 部署
  • 經驗教訓和行业洞察

總結和下一步行動

最低要求

  • 理解監督學習和強化學習的基本原理
  • 具備模型微調和神經網絡架構的經驗
  • 熟悉 Python 編程和深度學習框架(例如 TensorFlow, PyTorch)

受眾

  • 機器學習工程師
  • AI 研究人員
 14 小時

人數


每位參與者的報價

即將到來的課程

課程分類