感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程時長 14 時間:
課程簡介
使用開源工具介紹 AIOps
- AIOps 概念與益處概觀
- 可觀察性堆疊中的 Prometheus 和 Grafana
- ML 在 AIOps 中的角色:預測性分析與反應式分析
設定 Prometheus 和 Grafana
- 安裝並設定 Prometheus 以進行時間序列收集
- 使用即時指標在 Grafana 中創建儀表板
- 探索導出器(exporters)、重新標記(relabeling)和服務發現
針對 ML 的數據預處理
- 提取和轉換 Prometheus 指標
- 準備用於異常檢測和預測的數據集
- 使用 Grafana 的轉換功能或 Python 管道
應用機器學習進行異常檢測
- 用於離群值檢測的基本 ML 模型(例如:Isolation Forest、One-Class SVM)
- 在時間序列數據上訓練和評估模型
- 在 Grafana 儀表板中視覺化異常
使用 ML 預測指標
- 構建簡單的預測模型(ARIMA、Prophet、LSTM 簡介)
- 預測系統負載或資源使用率
- 利用預測結果進行早期告警和擴縮容決策
整合 ML 至告警與自動化
- 基於 ML 輸出或閾值定義告警規則
- 使用 Alertmanager 和通知路由
- 在檢測到異常時觸發腳本或自動化工作流程
擴展和運維化 AIOps
- 整合外部可觀察性工具(例如:ELK stack、Moogsoft、Dynatrace)
- 在可觀察性管道中運維化 ML 模型
- 大規模 AIOps 的最佳實踐
總結與後續步驟
最低要求
- 對系統監控和可觀察性概念的瞭解
- 使用 Grafana 或 Prometheus 的經驗
- 熟悉 Python 及基本的機器學習原則
受眾對象
- 可觀察性工程師
- 基礎設施與 DevOps 團隊
- 監控平台架構師與網站可靠性工程師(SREs)