Tack för att du skickade din fråga! En av våra teammedlemmar kontaktar dig snart.
Tack för att du skickade din bokning! En av våra teammedlemmar kontaktar dig snart.
Kursplan
Inledning, mål och migrationsstrategi
- Kursmål, anpassning till deltagarprofilen och kriterier för framgång
- Övergripande migrationsansatser och riskbedömning
- Uppställning av arbetsytor, repotitorier och laboratoriedata
Dag 1 — Migrationsgrunder och arkitektur
- Lakehouse-koncept, översikt över Delta Lake och Databricks-arkitektur
- Skillnader mellan SMP och MPP och deras konsekvenser för migration
- Design av Medallion (Bronze→Silver→Gold) och översikt över Unity Catalog
Dag 1 Lab — Översättning av en lagrad procedur
- Praktisk migration av en exempellagrad procedur till en anteckningsbok
- Mappning av tillfälliga tabeller och cursorer till DataFrame-transformeringar
- Validering och jämförelse med ursprunglig utdata
Dag 2 — Avancerad Delta Lake & inkrementell inläsning
- ACID-transaktioner, commit-loggar, versionshantering och tidsläge (time travel)
- Auto Loader, MERGE INTO-mönster, upserts och schemaevolution
- OPTIMIZE, VACUUM, Z-ORDER, partitionering och lagringsjustering
Dag 2 Lab — Inkrementell inläsning & optimering
- Implementering av inläsning med Auto Loader och MERGE-arbetsflöden
- Att applicera OPTIMIZE, Z-ORDER och VACUUM; validera resultat
- Mätning av förbättringar i läs-/skrivprestanda
Dag 3 — SQL i Databricks, prestanda & felsökning
- Analytiska SQL-funktioner: fönsterfunktioner, högreordnade funktioner, hantering av JSON/arrayer
- Läsning av Spark UI, DAG:er, shuffles, steg, uppgifter och diagnos av flaskhalsor
- Mönster för frågejustering: broadcast joins, hints, caching och minskad spill
Dag 3 Lab — SQL-omformulering & prestandaoptimering
- Omformulera en tung SQL-process till optimerad Spark SQL
- Använda Spark UI-spår för att identifiera och åtgärda skew- och shuffleproblem
- Genomför benchmarking före/efter och dokumentera justeringssteg
Dag 4 — Taktisk PySpark: Ersättning av prosedurlösning
- Sparks körningsmodell: driver, exekutorer, lat evaluering och partitioneringsstrategier
- Transformation av looper och cursorer till vektoriserade DataFrame-operationer
- Modularisering, UDF:er/pandas UDF:er, widgets och återanvändbara bibliotek
Dag 4 Lab — Omformulering av prosedurlösande skript
- Omformulera ett prosedurlösande ETL-skript till modulariserade PySpark-anteckningsböcker
- Införa parametrarisering, enhetsstest liknande tester och återanvändbara funktioner
- Kodgenomgång och tillämpning av kontrolllista för bästa praxis
Dag 5 — Orkestrering, komplett pipeline & bästa praxis
- Databricks Workflows: jobbdesign, uppgiftsberoenden, utlösare och felhantering
- Design av inkrementella Medallion-pipelines med kvalitetsregler och schemavalidering
- Integration med Git (GitHub/Azure DevOps), CI och teststrategier för PySpark-logik
Dag 5 Lab — Bygg en komplett pipeline från start till mål
- Sammansätt pipeline för Bronze→Silver→Gold orkestrerad med Workflows
- Implementera loggning, revision, återförsök och automatiserad validering
- Kör hela pipeline, validera utdata och förbered utrollningsanteckningar
Driftsättning, styrning och produktionsklarhet
- Bästa praxis för styrning i Unity Catalog, lineage och åtkomstkontroller
- Kostnad, storleksanpassning av cluster, autoskalning och mönster för jobbkonkurrens
- Kontrolllistor för utrollning, återskalningsstrategier och skapande av driftmanualer
Slutgryning, kunskapsoverföring och nästa steg
- Deltagarpresentationer av migrationsarbete och lärdomar
- Gapanalys, rekommenderade uppföljningsaktiviteter och överlämning av utbildningsmaterial
- Referenser, framtida lärandesvägar och stödalternativ
Krav
- Förståelse för koncept inom dataengineering
- Erfarenhet av SQL och lagrade procedurer (Synapse / SQL Server)
- Kännedom till ETL-orkestreringskoncept (ADF eller liknande)
Målgrupp
- Teknikchefer med bakgrund i dataengineering
- Dataingenjörer som överför procedurlösning för OLAP till Lakehouse-mönster
- Plattformsteckniker ansvariga för införandet av Databricks
35 Timmar