感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
AIOps 導論
- 什麼是 AIOps 以及它的重要性
- 傳統監控 vs. AIOps 驅動的可觀測性
- AIOps 架構與關鍵組件
收集與標準化運維資料
- 可觀測性資料類型:指標、日誌與追蹤
- 從多個來源(伺服器、容器、雲端)攝入資料
- 使用代理程式與匯出器(Prometheus, Beats, Fluentd)
資料關聯性分析與異常偵測
- 時間序列關聯性分析與統計方法
- 使用機器學習模型進行異常偵測
- 偵測分散式系統中的事件
警報與雜訊減低
- 設計智慧型警報規則與閾值
- 抑制、去重與警報分組
- 整合 Alertmanager, Slack, PagerDuty 或 Opsgenie
根本原因分析與視覺化
- 使用儀表板視覺化指標並偵測趨勢
- 探索事件與時間線以進行根本原因分析 (RCA)
- 使用分散式追蹤工具跨層級追蹤問題
自動化與修復
- 由事件觸發自動化腳本或工作流程
- 整合 ITSM 系統(ServiceNow, Jira)
- 使用案例:自我修復、擴縮容、流量重新導向
開源與商業 AIOps 平台
- 工具概覽:Prometheus, Grafana, ELK, Moogsoft, Dynatrace
- 選擇 AIOps 平台的評估標準
- 選定技術堆疊的演示與實作
總結與下一步
最低要求
- 理解 IT 運維與系統監控概念
- 具有監控工具或儀表板的使用經驗
- 熟悉基本的日誌與指標格式
適合對象
- 負責基礎架構與應用程式的運維團隊
- 網站可靠性工程師 (SRE)
- IT 監控與可觀測性團隊