聯繫我們
 課程時長 21 時間:

課程簡介

AI 增強的 Kubernetes 營運簡介

  • 為何 AI 對現代叢集營運至關重要
  • 傳統擴展與調度邏輯的局限性
  • 資源管理中的 ML 關鍵概念

Kubernetes 資源管理的基礎

  • CPU、GPU 和記憶體配置的基本概念
  • 理解配額、限制與請求
  • 識別瓶頸與效率低下的問題

用於調度的機器學習方法

  • 用於工作負載放置的監督式與非監督式模型
  • 資源需求預測演算法
  • 在自訂調度器中使用 ML 特徵

用於智慧自動擴展的強化學學

  • RL 代理如何從叢集行為中學習
  • 設計用於效率的獎勵函數
  • 建置由 RL 驅動的自動擴展策略

結合指標與遙測數據的預測式自動擴展

  • 使用 Prometheus 數據進行預測
  • 將時間序列模型應用於自動擴展
  • 評估預測準確度並調整模型

實施 AI 驅動的優化工具

  • 將 ML 框架與 Kubernetes 控制器整合
  • 部署智慧控制循環
  • 擴展 KEDA 以支援 AI 輔助決策

成本與效能最佳化策略

  • 透過預測式擴展降低運算成本
  • 利用 ML 驅動的放置改善 GPU 使用率
  • 平衡延遲時間、吞吐量與效率

實際場景與真實世界用例

  • 使用 AI 自動擴展高負載應用程式
  • 最佳化異構節點池
  • 在多租戶環境中應用 ML

總結與後續步驟

最低要求

  • 具備 Kubernetes 基礎知識
  • 具有容器化應用程式部署經驗
  • 熟悉叢集營運與資源管理

目標受眾

  • 處理大規模分佈式系統的 SRE
  • 管理高需求工作負載的 Kubernetes 營運人員
  • 最佳化運算基礎架構的平台工程師

人數


每位參與者的報價

客戶評論 (2)

即將到來的課程

課程分類