聯繫我們
 課程時長 35 時間:

課程簡介

SRE 反模式

  • 識別負面影響的實務做法
  • 認識反模式對可靠性的影響
  • 最佳實務與修正替代方案

以 SLO 作為顧客滿意度的代理指標

  • 定義服務層級指標(SLI)與服務層級目標(SLO)
  • 管理錯誤預算,平衡創新與可靠性
  • 理解分散式系統的極限

建立安全且可靠的系統

  • 設計容錯性與韌性
  • 將安全性整合至可靠性工程
  • 擴展性與數據保護策略

全堆疊可觀測性

  • 儀器化與指標收集
  • 分散式追蹤與合成監控
  • 以可觀測性為導向的開發

平台工程與 AIOps

  • 以平台為中心的工程方法
  • SRE 中的自動化與編排
  • 運用 DataOps 與營運智慧

SRE 中的事件管理

  • 事件回應中的角色與職責
  • 應用 OODA 等框架
  • 自動修復與 AI/ML 輔助解決

混沌工程

  • 韌性測試的原則與策略
  • 規劃並執行「Game Day」演練
  • 從受控失敗實驗中學習

SRE 作為 DevOps 的純粹形式

  • 將 SRE 整合至 DevOps 工作流程
  • 文化對齊與協作實務
  • 透過 SRE 推動組織轉型

課後演練

  • 大型系統設計案例研究
  • 進階儀器化與監控情境
  • 真實世界的可靠性問題解決

複習與考試準備

  • 最後複習 DevOps Institute SRE 實務師大綱
  • 樣題與模擬測試
  • 應考策略與建議

總結與下一步

最低要求

  • 理解網站可靠性工程(SRE)的核心原則
  • 具備 DevOps 實務及相關工具的使用經驗
  • 熟悉系統監控、事件管理及自動化流程

目標受眾

  • 尋求 DevOps Institute SRE 實務師認證的 SRE 專業人員
  • 希望拓展至專注於可靠性角色的 DevOps 工程師
  • 負責可靠性策略規劃與執行的營運主管

人數


每位參與者的報價

客戶評論 (2)

即將到來的課程

課程分類