Kom i kontakt
 Varaktighet 35 timmar

Kursplan

Databricks Platform and Lakehouse Fundamentals

  • Lakehouse-arkitektur och komponenter i Databricks
  • Organisera arbetsytor och kataloger

Databricks Workspace and Notebooks

  • Navigering i arbetsytan och anteckningsboksutveckling
  • Strukturera kod till återanvändbara anteckningsböcker

Apache Spark Architecture and Execution

  • Spark-runtidsarkitektur och exekveringsmodell
  • Lazy evaluation och jobbets DAG (Directed Acyclic Graph)

PySpark DataFrames and the DataFrame API

  • DataFrame-abstraktioner och scheman
  • Kärnoperationer för DataFrames och kolumnuttryck

Translating SQL to PySpark DataFrames

  • Översätta kärn-SQL-satser till DataFrame-operationer
  • Fönsterfunktioner och aggregationer i PySpark

Reading and Writing Data in Databricks

  • Läsa in data från vanliga fil- och databaskällor
  • Skriva och partitionera data i Lakehouse

Delta Lake and Table Management

  • Delta-tabeller och ACID-transaktioner
  • Tidresor (time travel) och schemautveckling

Data Cleaning and Transformation Patterns

  • Datarentning och typkonvertering
  • Bygga återanvändbar transformationslogik

User-Defined Functions and Modular Code

  • Python UDFs och pandas UDFs
  • Modularisera procedural logik till funktioner

Performance Tuning and Optimization

  • Partitionerings- och cachestrategier
  • Diagnostisera flaskhalsar med Spark UI

Structured Streaming Fundamentals

  • Batch kontra streaming-behandlingsmodeller
  • Streaming DataFrames och grundläggande aggregationer

Databricks Jobs and Workflow Orchestration

  • Schemalägga anteckningsböcker som jobb och uppgifter
  • Bygga multipelstegsarbetsflöden med beroenden

Unity Catalog and Data Governance

  • Unity Catalog-arkitektur och namnområden
  • Tillgångskontroll och dataspårning (data lineage)

Testing, Debugging, and Production Practices

  • Eenhets testning av PySpark-logik
  • Felsökning och kodkvalitetsstandarder

End-to-End Financial Services Use Cases

  • Bygga en helautomatiserad bank-ETL-pipeline
  • Översätta äldre SQL-processer till PySpark

Migrating SQL Workloads to PySpark

  • Migreringsstrategier och planeringsmönster
  • Inkrementell konvertering av SQL-arbetsflöden till PySpark

Krav

  • Erfarenhet av Python-programmering, inklusive funktioner och datatyper
  • Förståelse för SQL, inklusive joins, aggregationer och underfrågor
  • Ingen tidigare erfarenhet av Databricks eller PySpark krävs

Målgrupp

  • Dataingenjörer, dataanalytiker och databranschpersoner
  • Team som migrerar befintliga SQL-baserade arbetsflöden till Databricks och PySpark

Antal deltagare


Pris per deltagare

Vittnesmål (1)

Kommande Kurser

Relaterade Kategorier