聯繫我們

課程簡介

簡介、目標與遷移策略

  • 課程目標、參與者畫像對齊及成功標準
  • 高層面的遷移方法及風險考量
  • 設定工作區、儲存庫及實驗數據集

第 1 天 — 遷移基礎與架構

  • 湖倉一體概念、Delta Lake 概覽及 Databricks 架構
  • SMP 與 MPP 的差異及其對遷移的影響
  • Medallion(青銅→白銀→黃金)設計及 Unity Catalog 概覽

第 1 天實驗 — 轉譯儲存程序

  • 實作將範例儲存程序遷移至 Notebook
  • 將暫存表(Temp tables)及游標(Cursors)映射為 DataFrame 轉換
  • 驗證並與原始輸出進行比較

第 2 天 — 進階 Delta Lake 與增量載入

  • ACID 交易、提交日誌、版本控制及時間旅行(Time Travel)
  • Auto Loader、MERGE INTO 模式、Upsert 及模式演進(Schema Evolution)
  • OPTIMIZE、VACUUM、Z-ORDER、分區及儲存調優

第 2 天實驗 — 增量數據攝取與優化

  • 實現 Auto Loader 攝取及 MERGE 工作流
  • 應用 OPTIMIZE、Z-ORDER 及 VACUUM,並驗證結果
  • 衡量讀寫性能的改善

第 3 天 — Databricks 中的 SQL、性能與除錯

  • 分析型 SQL 功能:窗口函數、高階函數、JSON/數組處理
  • 閱讀 Spark UI、DAG、Shuffle、階段(Stages)、任務(Tasks)及瓶頸診斷
  • 查詢調優模式:廣播連接(Broadcast Joins)、提示(Hints)、緩存(Caching)及減少溢寫(Spill reduction)

第 3 天實驗 — SQL 重構與性能調優

  • 將重型 SQL 過程重構為優化的 Spark SQL
  • 使用 Spark UI 追蹤識別並修復數據傾斜(Skew)及 Shuffle 問題
  • 進行調前後基準測試並記錄調優步驟

第 4 天 — 戰術性 PySpark:取代程序化邏輯

  • Spark 執行模型:驅動器(Driver)、執行器(Executors)、延遲求值及分區策略
  • 將循環及游標轉化為向量化(Vectorized)的 DataFrame 操作
  • 模塊化、UDF/pandas UDF、小工具(Widgets)及可重用庫

第 4 天實驗 — 重構程序化腳本

  • 將程序化 ETL 腳本重構為模塊化的 PySpark Notebook
  • 引入參數化、單元式測試及可重用函數
  • 代碼審查及應用最佳實踐清單

第 5 天 — 編排、端到端管道與最佳實踐

  • Databricks Workflows:作業設計、任務依賴、觸發器及錯誤處理
  • 設計具有質量規則及模式驗證的增量 Medallion 管道
  • 與 Git(GitHub/Azure DevOps)、CI 及 PySpark 邏輯的測試策略集成

第 5 天實驗 — 構建完整的端到端管道

  • 組裝由 Workflows 編排的 青銅→白銀→黃金 管道
  • 實現日誌記錄、審計、重試及自動驗證
  • 運行完整管道、驗證輸出並準備部署說明

運營化、治理與生產就緒狀態

  • Unity Catalog 治理、數據血緣(Lineage)及訪問控制最佳實踐
  • 成本、集群規模調整、自動縮放及作業並發模式
  • 部署清單、回滾策略及運行手冊(Runbook)創建

最終回顧、知識轉移與後續步驟

  • 參與者展示遷移工作及經驗教訓
  • 差距分析、建議的後續活動及培訓材料移交
  • 參考資料、進一步學習路徑及支持選項

最低要求

  • 了解數據工程基本概念
  • 具有 SQL 及儲存程序經驗(Synapse / SQL Server)
  • 熟悉 ETL 編排概念(ADF 或類似工具)

目標受眾

  • 具備數據工程背景的技術管理者
  • 希望將程序化 OLAP 邏輯轉為湖倉模式的數據工程師
  • 負責 Databricks 導入的平台工程師
 35 小時

人數


每位參與者的報價

即將到來的課程

課程分類