聯繫我們
 課程時長 14 時間:

課程簡介

預測性 AIOps 簡介

  • IT 營運中預測性分析概觀
  • 預測數據來源(日誌、指標、事件)
  • 時間序列預測與異常模式的核心概念

設計事故預測模型

  • 對歷史事故和系統行為進行標記
  • 選擇並訓練模型(例如:LSTM、隨機森林、AutoML)
  • 評估模型效能及處理假陽性

數據收集與特徵工程

  • 匯入並對齊日誌和指標數據以作為模型輸入
  • 從結構化和非結構化數據中提取特徵
  • 在運營管線中處理噪音和缺失數據

自動化根本原因分析(RCA)

  • 服務與基礎設施的圖形關聯分析
  • 利用機器學習從事件鏈中推斷可能的根本原因
  • 透過支援拓撲的儀表板視覺化 RCA

修復與工作流程自動化

  • 與自動化平台整合(例如:Ansible、Rundeck)
  • 觸發回滾、重啟或流量重導向
  • 審核並記錄自動化干預措施

擴展智能 AIOps 管線

  • 面向可觀測性的 MLOps:再訓練與模型版本控制
  • 在分散式節點上進行實時預測
  • 在生產環境中部署 AIOps 的最佳實踐

案例研究與實際應用

  • 使用預測性 AIOps 模型分析真實事故數據
  • 使用合成數據和生產數據部署 RCA 管線
  • 行業用例回顧:雲端中斷、微服務不穩定、網絡性能下降

總結與後續步驟

最低要求

  • 具備使用 Prometheus 或 ELK 等監控系統的经验
  • 熟悉 Python 及基礎機器學習概念
  • 了解事故管理工作流程

適合對象

  • 高階網站可靠性工程師(SRE)
  • IT 自動化架構師
  • DevOps 及可觀測性平台負責人

人數


每位參與者的報價

即將到來的課程

課程分類