感謝您提交詢問!我們的一位團隊成員將在短時間內與您聯繫。
感謝您提交預訂!我們的一位團隊成員將在短時間內與您聯繫。
課程簡介
Databricks 平台與湖倉一體基礎知識
- Databricks 湖倉一體的架構與組件。
- 工作區與目錄的組織管理。
Databricks 工作區與筆記本
- 工作區導航及基於筆記本的開發方式。
- 將代碼結構化並組建為可重用的筆記本。
Apache Spark 架構與執行機制
- Spark 運行時架構與執行模型。
- 惰性求值與作業 DAG(有向無環圖)。
PySpark DataFrames 與 DataFrame API
- DataFrame 抽象概念與模式定義。
- 核心 DataFrame 操作及列表達式。
將 SQL 轉換為 PySpark DataFrames
- 將核心 SQL 子句轉換為 DataFrame 操作。
- 在 PySpark 中使用視窗函數與聚合操作。
在 Databricks 中讀取與寫入數據
- 從常見的檔案與資料庫來源讀取數據。
- 在湖倉一體環境中寫入及分區數據。
Delta Lake 與表管理
- Delta 表與 ACID 事務處理。
- 時間旅行(Time Travel)與模式演化。
數據清理與轉換模式
- 數據清理與類型轉換。
- 構建可重用的轉換邏輯。
自定義函數與模塊化代碼
- Python UDF 和 pandas UDF 的使用。
- 將過程化邏輯模塊化爲函數。
性能調優與優化
- 分區與緩存策略。
- 通過 Spark UI 診斷瓶頸。
結構化流基礎知識
- 批處理與流處理模型對比。
- 流式 DataFrames 與基本聚合操作。
Databricks 作業與工作流編排
- 將筆記本調度爲作業與任務。
- 構建具有依賴關係的多步驟工作流。
Unity Catalog 與數據治理
- Unity Catalog 架構與命名空間。
- 訪問控制與數據線索追蹤。
測試、調試與生產實踐
- 對 PySpark 邏輯進行單元測試。
- 調試方法與代碼質量標準。
端到端金融服務用例
- 構建端到端的銀行 ETL 流水線。
- 將傳統 SQL 流程轉換爲 PySpark。
將 SQL 負載遷移至 PySpark
- 遷移策略與規劃模式。
- 逐步將 SQL 工作流程轉換爲 PySpark。
最低要求
- 具備 Python 編程經驗,包括函數和數據類型的使用。
- 理解 SQL,包括連接、聚合和子查詢。
- 無需之前使用 Databricks 或 PySpark 的經驗。
受眾
- 數據工程師、數據分析師及數據專業人士。
- 團隊正在將現有的基於 SQL 的工作流程遷移至 Databricks 和 PySpark。
35 小時
客戶評論 (1)
我喜歡它的實用性。非常喜歡將理論知識應用到實際例子中。
Aurelia-Adriana - Allianz Services Romania
課程 - Python and Spark for Big Data (PySpark)
機器翻譯