聯繫我們

課程簡介

Databricks 平台與湖倉一體基礎知識

  • Databricks 湖倉一體的架構與組件。
  • 工作區與目錄的組織管理。

Databricks 工作區與筆記本

  • 工作區導航及基於筆記本的開發方式。
  • 將代碼結構化並組建為可重用的筆記本。

Apache Spark 架構與執行機制

  • Spark 運行時架構與執行模型。
  • 惰性求值與作業 DAG(有向無環圖)。

PySpark DataFrames 與 DataFrame API

  • DataFrame 抽象概念與模式定義。
  • 核心 DataFrame 操作及列表達式。

將 SQL 轉換為 PySpark DataFrames

  • 將核心 SQL 子句轉換為 DataFrame 操作。
  • 在 PySpark 中使用視窗函數與聚合操作。

在 Databricks 中讀取與寫入數據

  • 從常見的檔案與資料庫來源讀取數據。
  • 在湖倉一體環境中寫入及分區數據。

Delta Lake 與表管理

  • Delta 表與 ACID 事務處理。
  • 時間旅行(Time Travel)與模式演化。

數據清理與轉換模式

  • 數據清理與類型轉換。
  • 構建可重用的轉換邏輯。

自定義函數與模塊化代碼

  • Python UDF 和 pandas UDF 的使用。
  • 將過程化邏輯模塊化爲函數。

性能調優與優化

  • 分區與緩存策略。
  • 通過 Spark UI 診斷瓶頸。

結構化流基礎知識

  • 批處理與流處理模型對比。
  • 流式 DataFrames 與基本聚合操作。

Databricks 作業與工作流編排

  • 將筆記本調度爲作業與任務。
  • 構建具有依賴關係的多步驟工作流。

Unity Catalog 與數據治理

  • Unity Catalog 架構與命名空間。
  • 訪問控制與數據線索追蹤。

測試、調試與生產實踐

  • 對 PySpark 邏輯進行單元測試。
  • 調試方法與代碼質量標準。

端到端金融服務用例

  • 構建端到端的銀行 ETL 流水線。
  • 將傳統 SQL 流程轉換爲 PySpark。

將 SQL 負載遷移至 PySpark

  • 遷移策略與規劃模式。
  • 逐步將 SQL 工作流程轉換爲 PySpark。

最低要求

  • 具備 Python 編程經驗,包括函數和數據類型的使用。
  • 理解 SQL,包括連接、聚合和子查詢。
  • 無需之前使用 Databricks 或 PySpark 的經驗。

受眾

  • 數據工程師、數據分析師及數據專業人士。
  • 團隊正在將現有的基於 SQL 的工作流程遷移至 Databricks 和 PySpark。
 35 小時

人數


每位參與者的報價

客戶評論 (1)

即將到來的課程

課程分類