Kursplan
Databricks Platform and Lakehouse Fundamentals
- Lakehouse-arkitektur och komponenter i Databricks
- Organisera arbetsytor och kataloger
Databricks Workspace and Notebooks
- Navigering i arbetsytan och anteckningsboksutveckling
- Strukturera kod till återanvändbara anteckningsböcker
Apache Spark Architecture and Execution
- Spark-runtidsarkitektur och exekveringsmodell
- Lazy evaluation och jobbets DAG (Directed Acyclic Graph)
PySpark DataFrames and the DataFrame API
- DataFrame-abstraktioner och scheman
- Kärnoperationer för DataFrames och kolumnuttryck
Translating SQL to PySpark DataFrames
- Översätta kärn-SQL-satser till DataFrame-operationer
- Fönsterfunktioner och aggregationer i PySpark
Reading and Writing Data in Databricks
- Läsa in data från vanliga fil- och databaskällor
- Skriva och partitionera data i Lakehouse
Delta Lake and Table Management
- Delta-tabeller och ACID-transaktioner
- Tidresor (time travel) och schemautveckling
Data Cleaning and Transformation Patterns
- Datarentning och typkonvertering
- Bygga återanvändbar transformationslogik
User-Defined Functions and Modular Code
- Python UDFs och pandas UDFs
- Modularisera procedural logik till funktioner
Performance Tuning and Optimization
- Partitionerings- och cachestrategier
- Diagnostisera flaskhalsar med Spark UI
Structured Streaming Fundamentals
- Batch kontra streaming-behandlingsmodeller
- Streaming DataFrames och grundläggande aggregationer
Databricks Jobs and Workflow Orchestration
- Schemalägga anteckningsböcker som jobb och uppgifter
- Bygga multipelstegsarbetsflöden med beroenden
Unity Catalog and Data Governance
- Unity Catalog-arkitektur och namnområden
- Tillgångskontroll och dataspårning (data lineage)
Testing, Debugging, and Production Practices
- Eenhets testning av PySpark-logik
- Felsökning och kodkvalitetsstandarder
End-to-End Financial Services Use Cases
- Bygga en helautomatiserad bank-ETL-pipeline
- Översätta äldre SQL-processer till PySpark
Migrating SQL Workloads to PySpark
- Migreringsstrategier och planeringsmönster
- Inkrementell konvertering av SQL-arbetsflöden till PySpark
Krav
- Erfarenhet av Python-programmering, inklusive funktioner och datatyper
- Förståelse för SQL, inklusive joins, aggregationer och underfrågor
- Ingen tidigare erfarenhet av Databricks eller PySpark krävs
Målgrupp
- Dataingenjörer, dataanalytiker och databranschpersoner
- Team som migrerar befintliga SQL-baserade arbetsflöden till Databricks och PySpark
Vittnesmål (1)
Jag tyckte att det var praktiskt. Älskade att tillämpa den teoretiska kunskapen med praktiska exempel.
Aurelia-Adriana - Allianz Services Romania
Kurs - Python and Spark for Big Data (PySpark)
Maskintolkat