感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
簡介、目標與遷移策略
- 課程目標、參與者畫像對齊及成功標準
- 高層面的遷移方法及風險考量
- 設定工作區、儲存庫及實驗數據集
第 1 天 — 遷移基礎與架構
- 湖倉一體概念、Delta Lake 概覽及 Databricks 架構
- SMP 與 MPP 的差異及其對遷移的影響
- Medallion(青銅→白銀→黃金)設計及 Unity Catalog 概覽
第 1 天實驗 — 轉譯儲存程序
- 實作將範例儲存程序遷移至 Notebook
- 將暫存表(Temp tables)及游標(Cursors)映射為 DataFrame 轉換
- 驗證並與原始輸出進行比較
第 2 天 — 進階 Delta Lake 與增量載入
- ACID 交易、提交日誌、版本控制及時間旅行(Time Travel)
- Auto Loader、MERGE INTO 模式、Upsert 及模式演進(Schema Evolution)
- OPTIMIZE、VACUUM、Z-ORDER、分區及儲存調優
第 2 天實驗 — 增量數據攝取與優化
- 實現 Auto Loader 攝取及 MERGE 工作流
- 應用 OPTIMIZE、Z-ORDER 及 VACUUM,並驗證結果
- 衡量讀寫性能的改善
第 3 天 — Databricks 中的 SQL、性能與除錯
- 分析型 SQL 功能:窗口函數、高階函數、JSON/數組處理
- 閱讀 Spark UI、DAG、Shuffle、階段(Stages)、任務(Tasks)及瓶頸診斷
- 查詢調優模式:廣播連接(Broadcast Joins)、提示(Hints)、緩存(Caching)及減少溢寫(Spill reduction)
第 3 天實驗 — SQL 重構與性能調優
- 將重型 SQL 過程重構為優化的 Spark SQL
- 使用 Spark UI 追蹤識別並修復數據傾斜(Skew)及 Shuffle 問題
- 進行調前後基準測試並記錄調優步驟
第 4 天 — 戰術性 PySpark:取代程序化邏輯
- Spark 執行模型:驅動器(Driver)、執行器(Executors)、延遲求值及分區策略
- 將循環及游標轉化為向量化(Vectorized)的 DataFrame 操作
- 模塊化、UDF/pandas UDF、小工具(Widgets)及可重用庫
第 4 天實驗 — 重構程序化腳本
- 將程序化 ETL 腳本重構為模塊化的 PySpark Notebook
- 引入參數化、單元式測試及可重用函數
- 代碼審查及應用最佳實踐清單
第 5 天 — 編排、端到端管道與最佳實踐
- Databricks Workflows:作業設計、任務依賴、觸發器及錯誤處理
- 設計具有質量規則及模式驗證的增量 Medallion 管道
- 與 Git(GitHub/Azure DevOps)、CI 及 PySpark 邏輯的測試策略集成
第 5 天實驗 — 構建完整的端到端管道
- 組裝由 Workflows 編排的 青銅→白銀→黃金 管道
- 實現日誌記錄、審計、重試及自動驗證
- 運行完整管道、驗證輸出並準備部署說明
運營化、治理與生產就緒狀態
- Unity Catalog 治理、數據血緣(Lineage)及訪問控制最佳實踐
- 成本、集群規模調整、自動縮放及作業並發模式
- 部署清單、回滾策略及運行手冊(Runbook)創建
最終回顧、知識轉移與後續步驟
- 參與者展示遷移工作及經驗教訓
- 差距分析、建議的後續活動及培訓材料移交
- 參考資料、進一步學習路徑及支持選項
最低要求
- 了解數據工程基本概念
- 具有 SQL 及儲存程序經驗(Synapse / SQL Server)
- 熟悉 ETL 編排概念(ADF 或類似工具)
目標受眾
- 具備數據工程背景的技術管理者
- 希望將程序化 OLAP 邏輯轉為湖倉模式的數據工程師
- 負責 Databricks 導入的平台工程師
35 小時