感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
預測性 AIOps 簡介
- IT 營運中預測性分析概觀
- 預測數據來源(日誌、指標、事件)
- 時間序列預測與異常模式的核心概念
設計事故預測模型
- 對歷史事故和系統行為進行標記
- 選擇並訓練模型(例如:LSTM、隨機森林、AutoML)
- 評估模型效能及處理假陽性
數據收集與特徵工程
- 匯入並對齊日誌和指標數據以作為模型輸入
- 從結構化和非結構化數據中提取特徵
- 在運營管線中處理噪音和缺失數據
自動化根本原因分析(RCA)
- 服務與基礎設施的圖形關聯分析
- 利用機器學習從事件鏈中推斷可能的根本原因
- 透過支援拓撲的儀表板視覺化 RCA
修復與工作流程自動化
- 與自動化平台整合(例如:Ansible、Rundeck)
- 觸發回滾、重啟或流量重導向
- 審核並記錄自動化干預措施
擴展智能 AIOps 管線
- 面向可觀測性的 MLOps:再訓練與模型版本控制
- 在分散式節點上進行實時預測
- 在生產環境中部署 AIOps 的最佳實踐
案例研究與實際應用
- 使用預測性 AIOps 模型分析真實事故數據
- 使用合成數據和生產數據部署 RCA 管線
- 行業用例回顧:雲端中斷、微服務不穩定、網絡性能下降
總結與後續步驟
最低要求
- 具備使用 Prometheus 或 ELK 等監控系統的经验
- 熟悉 Python 及基礎機器學習概念
- 了解事故管理工作流程
適合對象
- 高階網站可靠性工程師(SRE)
- IT 自動化架構師
- DevOps 及可觀測性平台負責人