聯繫我們

課程簡介

Kafka 管理核心

  • Kafka 在現代數據平台中的定位及典型的生產環境職責
  • 運維人員的核心概念:Broker、主題、分區、偏移量、消費者組
  • 複製基礎知識:Leader 和 Follower、ISR(同步複製集)、可用性權衡
  • Kafka 運維亮點及運行手冊中使用的常見術語

KRaft 模式與集羣設計

  • KRaft 基礎:Controller、元數據法定人數、選舉及其對運維的重要性
  • 部署規劃:針對吞吐量、分區數、保留期和增長的規模設定
  • 節點角色和佈局:合併式與獨立 Controller、故障域考量
  • 實驗:檢查 KRaft 元數據,驗證法定人數健康狀況並解析 Controller 日誌

安裝、配置與日常運維

  • 安裝方式(包管理器、tarball、容器)及企業環境中應標準化的內容
  • 影響可靠性的核心 Broker 配置:Listeners、複製、日誌目錄、保留策略
  • 安全的服務操作:啟動順序、優雅關閉及驗證檢查
  • 實驗:部署多節點集羣,驗證 Broker 註冊並確認基本的生產和消費功能

管理主題、分區與數據放置

  • 使用 Kafka CLI 管理主題生命周期:創建、描述、更新配置、刪除
  • 為實際工作負載選擇分區數和複製因子,包括常見的反模式
  • 重新分配與平衡:何時移動分區及如何安全地驗證進度
  • 實驗:創建主題,觸發分區重新分配,模擬 Broker 故障並確認恢復

Kafka 生產環境安全

  • TLS 用於客戶端和 Broker 間流量:證書、信任鏈及驗證步驟
  • SASL 身份驗證:選擇常見的機制並避免錯誤配置
  • 基於 ACLs 的授權:針對管理員、生產者和消費者的最小權限模式
  • 實驗:啟用 TLS 和 SASL,驗證客戶端連接性,並為應用角色應用 ACLs

可觀測性、可靠性與故障排除

  • 監控基礎知識:Controller 健康狀況、副本不足的分區、請求延遲、磁盤和網絡飽和度
  • 日誌與指標:讀取 Broker 日誌並通過 JMX Exporter 向常見的可觀測性棧公開指標
  • 運維手冊:滾動重啟、安全配置更改、處理磁盤滿和 ISR 問題
  • 實驗:構建最小警報集,診斷性能下降的集羣並恢復健康的複製

升級與災難準備

  • Kafka 升級規劃:兼容性檢查、預演及回退方案
  • 備份與恢復預期:可備份的內容、不可備份的內容及配置恢復基礎知識
  • 跨集羣複製概述及何時使用 MirrorMaker 2 進行災難恢復和遷移
  • 總結:運維檢查清單、交接文件及生產環境推出的後續步驟

最低要求

  • 具備基本 Linux 系統管理知識(用戶、服務、文件、權限)
  • 熟悉 TCP/IP 網絡概念(DNS、端口、防火牆、負載均衡器)
  • 具備基本的腳本編程經驗(Bash、PowerShell 或類似工具),用於常規運維任務

受眾

  • Kafka 管理員和平台工程師,負責運行 Kafka 集羣
  • 支持流數據平台的站點可靠性工程師和 DevOps 工程師
  • 部署新的基於 KRaft 的 Kafka 集羣或從 ZooKeeper 遷移的基礎設施和運維團隊
 21 小時

人數


每位參與者的報價

客戶評論 (5)

即將到來的課程

課程分類