Oversigt over Delta Lake

Microsoft Fabric bruger Delta Lake som sit universelle lagringsformat på tværs af alle arbejdsbelastninger. Uanset om du bygger datawarehouses, skaber lakehouses, orkestrerer pipelines eller analyserer data med Power BI, bliver dine data gemt i Delta Lake-format i OneLake.

I de fleste scenarier fungerer Delta Lake gennemsigtigt i baggrunden – du behøver ikke forstå det for at bruge Fabric effektivt. Men når du optimerer ydeevnen, integrerer med eksterne systemer eller fejlsøger scenarier på tværs af arbejdsbyrder, hjælper forståelsen af Delta Lake dig med at arbejde mere effektivt.

Hvad er Delta Lake?

Delta Lake er et open source-lagringslag, der bringer pålidelighed og ydeevne til datalakes. I sin kerne kombinerer Delta Lake to elementer:

  • Parketfiler — Et effektivt kolonnelagringsformat til analyse.
  • Transaktionslog — En registrering af alle ændringer i dataene, der muliggør ACID-garantier.

Denne kombination giver funktioner, som traditionel filbaseret lagring ikke kan tilbyde:

  • ACID-transaktioner: Atomare, konsistente, isolerede og holdbare operationer sikrer dataintegritet, selv når flere processer læser og skriver samtidig
  • Tidsrejse: Forespørg data, som de eksisterede på et givent tidspunkt, rull fejl tilbage eller revider historiske ændringer
  • Skemaudvikling: Tilføje, fjern eller modificere kolonner uden at omskrive eksisterende data
  • Unified batch og streaming: Behandl realtids- og batchdata ved brug af samme tabelformat

Delta Lake vedligeholdes som et Linux Foundation-projekt med en åben specifikation, hvilket betyder, at det fungerer på tværs af platforme—Databricks, Azure Synapse Analytics, AWS og open source Apache Spark-miljøer understøtter alle Delta Lake-tabeller.

Hvorfor Fabric bruger Delta Lake

Microsoft Fabric valgte Delta Lake som sit universelle format for at løse en grundlæggende udfordring: at gøre det muligt for alle arbejdsbelastninger at dele data uden duplikation eller komplekse ETL-processer.

OneLake + Delta Lake = enkelt sandhedskilde

OneLake gemmer alle data som Delta Parquet som standard. Denne arkitektoniske beslutning betyder:

  • Ingen datasiloer: Et lakehouse, lager og KQL-database kan alle læse fra den samme Delta-tabel
  • Ingen ETL mellem arbejdsbelastninger: Data skrevet af én engine er straks læsbare for andre
  • Én kopi af data: Din organisation vedligeholder en enkelt version af sandheden, hvilket reducerer lageromkostninger og eliminerer problemer med datasynkronisering

Ydelsesoptimering bygget på Delta

Fabric udvider Delta Lake med ydeevnefunktioner designet til platformen:

  • V-Order: Fabric-specifik skriveoptimering, der omorganiserer data for hurtigere forespørgselsydelse på tværs af alle motorer
  • Automatisk tabelvedligeholdelse: Fabric kan automatisk komprimere små filer og rydde op i gamle data
  • Integration med Fabric services: Delta-tabeller fungerer problemfrit med Power BI Direct Lake, SQL-analyseendepunkter, pipelines og notebooks

Denne kombination af åbne standarder og Fabric-optimeringer giver dig både portabilitet og ydeevne.

Forståelse af din Delta Lake-rejse

Hvor meget du behøver at vide om Delta Lake afhænger af, hvad du laver i Fabric:

Delta Lake er gennemsigtig for de fleste brugere

Hvis du arbejder med disse scenarier, håndterer Fabric automatisk Delta Lake:

  • Forespørgsler data med SQL: SQL-analyse-endpoints og datalagre abstraherer Delta bag en SQL-grænseflade—du forespørger tabeller med T-SQL uden at tænke på filformater
  • Bygger rapporter i Power BI: Power BI Direct Lake læser Delta-tabeller problemfrit for at levere realtidsanalyser
  • Indlæsning af data med pipelines: Data Factorys kopieringsaktivitet skriver som standard til Delta-format, når man målretter lakehouse-tabeller

For disse oplevelser er Delta Lake en implementeringsdetalje, du ikke behøver at administrere.

Du har gavn af at forstå Delta, når

Visse scenarier kræver kendskab til Delta Lakes funktioner:

  • Optimering af forespørgselsydelse: Forståelse af V-Order, tabelkomprimering og partitioneringsstrategier hjælper dig med at tune tabeller til hurtigere forespørgsler
  • Integration med eksterne Delta-tabeller: At forbinde til Delta-tabeller i Databricks, Snowflake, Amazon S3 eller andre platforme kræver kendskab til funktionskompatibilitet
  • Brug af avancerede Spark-funktioner: Sletningsvektorer, kolonnemapping, typeudvidelse og væskeklyngedannelse giver kraftfulde funktioner, men kræver eksplicit konfiguration
  • Fejlfinding af scenarier på tværs af arbejdsbelastninger: Når data skrevet af én motor ikke opfører sig som forventet i en anden, hjælper forståelsen af Delta-funktionsunderstøttelse dig med at diagnosticere problemer

Valg af din læringsvej

Dit indgangspunkt til Delta Lake-dokumentation afhænger af din rolle:

Dataingeniører og Spark-udviklere bør starte med Lakehouse- og Delta Lake-tabeller for omfattende dækning af Delta i Spark-kontekster, herunder optimeringsmønstre, tabelvedligeholdelse og runtime-konfigurationer.

SQL-brugere og data warehouse udviklere bør udforske data warehouse arkitektur for at forstå, hvordan Delta understøtter warehouse-funktioner som tidsrejser, kloner og ACID-overholdelse.

Udviklere af pipeline- og dataintegration bør gennemgå Lakehouse connector i Data Factory for at lære, hvordan pipelines skriver Delta-tabeller og håndterer kolonnemapping.

Alle, der arbejder på tværs af arbejdsbelastninger bør henvise til Delta Lake table format interoperabilitet for den autoritative funktionsunderstøttelsesmatrix, der viser, hvilke Delta-funktioner der fungerer i hver Fabric oplevelse.

Tabeloptimering og vedligeholdelse

Selvom Fabric håndterer mange optimeringsopgaver automatisk, kan du forbedre ydeevnen i specifikke scenarier:

  • V-Order optimering: Skriv data med V-Order aktiveret for at forbedre læseydelsen på tværs af alle forespørgselsmotorer
  • Tabelkompaktion: Kombiner små filer til større ved hjælp af OPTIME-kommandoer for at reducere forespørgselsoverhead
  • Z-orden: Organiser data efter ofte filtrerede kolonner for at fremskynde selektive forespørgsler
  • Vakuumoperationer: Fjern gamle filversioner for at reducere lageromkostningerne

For detaljeret vejledning om, hvornår og hvordan man bruger disse teknikker på tværs af forskellige arbejdsbelastninger, se Table maintenance and optimization.

Delta Lake og eksterne systemer

Delta Lakes åbne specifikation muliggør integration med systemer uden for Fabric:

  • OneLake-genveje: Reference Delta-tabeller gemt i Amazon S3, Azure Data Lake Storage eller Databricks uden at kopiere data
  • Delta deling: Del Delta-tabeller på tværs af organisationer ved brug af den åbne Delta Sharing-protokol
  • Platformtværlig kompatibilitet: Tabeller oprettet i Databricks eller Azure Synapse kan læses i Fabric, underlagt funktionsunderstøttelsesbegrænsninger

Når du integrerer eksterne Delta-tabeller, konsulter feature interoperabilitetsmatrixen for at forstå, hvilke Delta Lake-funktioner der understøttes af hver Fabric erfaring.