Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
Microsoft Fabric bruger Delta Lake som sit universelle lagringsformat på tværs af alle arbejdsbelastninger. Uanset om du bygger datawarehouses, skaber lakehouses, orkestrerer pipelines eller analyserer data med Power BI, bliver dine data gemt i Delta Lake-format i OneLake.
I de fleste scenarier fungerer Delta Lake gennemsigtigt i baggrunden – du behøver ikke forstå det for at bruge Fabric effektivt. Men når du optimerer ydeevnen, integrerer med eksterne systemer eller fejlsøger scenarier på tværs af arbejdsbyrder, hjælper forståelsen af Delta Lake dig med at arbejde mere effektivt.
Hvad er Delta Lake?
Delta Lake er et open source-lagringslag, der bringer pålidelighed og ydeevne til datalakes. I sin kerne kombinerer Delta Lake to elementer:
- Parketfiler — Et effektivt kolonnelagringsformat til analyse.
- Transaktionslog — En registrering af alle ændringer i dataene, der muliggør ACID-garantier.
Denne kombination giver funktioner, som traditionel filbaseret lagring ikke kan tilbyde:
- ACID-transaktioner: Atomare, konsistente, isolerede og holdbare operationer sikrer dataintegritet, selv når flere processer læser og skriver samtidig
- Tidsrejse: Forespørg data, som de eksisterede på et givent tidspunkt, rull fejl tilbage eller revider historiske ændringer
- Skemaudvikling: Tilføje, fjern eller modificere kolonner uden at omskrive eksisterende data
- Unified batch og streaming: Behandl realtids- og batchdata ved brug af samme tabelformat
Delta Lake vedligeholdes som et Linux Foundation-projekt med en åben specifikation, hvilket betyder, at det fungerer på tværs af platforme—Databricks, Azure Synapse Analytics, AWS og open source Apache Spark-miljøer understøtter alle Delta Lake-tabeller.
Hvorfor Fabric bruger Delta Lake
Microsoft Fabric valgte Delta Lake som sit universelle format for at løse en grundlæggende udfordring: at gøre det muligt for alle arbejdsbelastninger at dele data uden duplikation eller komplekse ETL-processer.
OneLake + Delta Lake = enkelt sandhedskilde
OneLake gemmer alle data som Delta Parquet som standard. Denne arkitektoniske beslutning betyder:
- Ingen datasiloer: Et lakehouse, lager og KQL-database kan alle læse fra den samme Delta-tabel
- Ingen ETL mellem arbejdsbelastninger: Data skrevet af én engine er straks læsbare for andre
- Én kopi af data: Din organisation vedligeholder en enkelt version af sandheden, hvilket reducerer lageromkostninger og eliminerer problemer med datasynkronisering
Ydelsesoptimering bygget på Delta
Fabric udvider Delta Lake med ydeevnefunktioner designet til platformen:
- V-Order: Fabric-specifik skriveoptimering, der omorganiserer data for hurtigere forespørgselsydelse på tværs af alle motorer
- Automatisk tabelvedligeholdelse: Fabric kan automatisk komprimere små filer og rydde op i gamle data
- Integration med Fabric services: Delta-tabeller fungerer problemfrit med Power BI Direct Lake, SQL-analyseendepunkter, pipelines og notebooks
Denne kombination af åbne standarder og Fabric-optimeringer giver dig både portabilitet og ydeevne.
Forståelse af din Delta Lake-rejse
Hvor meget du behøver at vide om Delta Lake afhænger af, hvad du laver i Fabric:
Delta Lake er gennemsigtig for de fleste brugere
Hvis du arbejder med disse scenarier, håndterer Fabric automatisk Delta Lake:
- Forespørgsler data med SQL: SQL-analyse-endpoints og datalagre abstraherer Delta bag en SQL-grænseflade—du forespørger tabeller med T-SQL uden at tænke på filformater
- Bygger rapporter i Power BI: Power BI Direct Lake læser Delta-tabeller problemfrit for at levere realtidsanalyser
- Indlæsning af data med pipelines: Data Factorys kopieringsaktivitet skriver som standard til Delta-format, når man målretter lakehouse-tabeller
For disse oplevelser er Delta Lake en implementeringsdetalje, du ikke behøver at administrere.
Du har gavn af at forstå Delta, når
Visse scenarier kræver kendskab til Delta Lakes funktioner:
- Optimering af forespørgselsydelse: Forståelse af V-Order, tabelkomprimering og partitioneringsstrategier hjælper dig med at tune tabeller til hurtigere forespørgsler
- Integration med eksterne Delta-tabeller: At forbinde til Delta-tabeller i Databricks, Snowflake, Amazon S3 eller andre platforme kræver kendskab til funktionskompatibilitet
- Brug af avancerede Spark-funktioner: Sletningsvektorer, kolonnemapping, typeudvidelse og væskeklyngedannelse giver kraftfulde funktioner, men kræver eksplicit konfiguration
- Fejlfinding af scenarier på tværs af arbejdsbelastninger: Når data skrevet af én motor ikke opfører sig som forventet i en anden, hjælper forståelsen af Delta-funktionsunderstøttelse dig med at diagnosticere problemer
Valg af din læringsvej
Dit indgangspunkt til Delta Lake-dokumentation afhænger af din rolle:
Dataingeniører og Spark-udviklere bør starte med Lakehouse- og Delta Lake-tabeller for omfattende dækning af Delta i Spark-kontekster, herunder optimeringsmønstre, tabelvedligeholdelse og runtime-konfigurationer.
SQL-brugere og data warehouse udviklere bør udforske data warehouse arkitektur for at forstå, hvordan Delta understøtter warehouse-funktioner som tidsrejser, kloner og ACID-overholdelse.
Udviklere af pipeline- og dataintegration bør gennemgå Lakehouse connector i Data Factory for at lære, hvordan pipelines skriver Delta-tabeller og håndterer kolonnemapping.
Alle, der arbejder på tværs af arbejdsbelastninger bør henvise til Delta Lake table format interoperabilitet for den autoritative funktionsunderstøttelsesmatrix, der viser, hvilke Delta-funktioner der fungerer i hver Fabric oplevelse.
Tabeloptimering og vedligeholdelse
Selvom Fabric håndterer mange optimeringsopgaver automatisk, kan du forbedre ydeevnen i specifikke scenarier:
- V-Order optimering: Skriv data med V-Order aktiveret for at forbedre læseydelsen på tværs af alle forespørgselsmotorer
- Tabelkompaktion: Kombiner små filer til større ved hjælp af OPTIME-kommandoer for at reducere forespørgselsoverhead
- Z-orden: Organiser data efter ofte filtrerede kolonner for at fremskynde selektive forespørgsler
- Vakuumoperationer: Fjern gamle filversioner for at reducere lageromkostningerne
For detaljeret vejledning om, hvornår og hvordan man bruger disse teknikker på tværs af forskellige arbejdsbelastninger, se Table maintenance and optimization.
Delta Lake og eksterne systemer
Delta Lakes åbne specifikation muliggør integration med systemer uden for Fabric:
- OneLake-genveje: Reference Delta-tabeller gemt i Amazon S3, Azure Data Lake Storage eller Databricks uden at kopiere data
- Delta deling: Del Delta-tabeller på tværs af organisationer ved brug af den åbne Delta Sharing-protokol
- Platformtværlig kompatibilitet: Tabeller oprettet i Databricks eller Azure Synapse kan læses i Fabric, underlagt funktionsunderstøttelsesbegrænsninger
Når du integrerer eksterne Delta-tabeller, konsulter feature interoperabilitetsmatrixen for at forstå, hvilke Delta Lake-funktioner der understøttes af hver Fabric erfaring.
Relateret indhold
- Delta Lake table format interoperability — Funktionsunderstøttelsesmatrix for Delta-funktioner på tværs af Fabric arbejdsbelastninger
- Lakehouse- og Delta Lake-borde — Omfattende guide til Spark-udviklere
- Tabelvedligeholdelse og optimering — Strategier for tværarbejdsbelastningsoptimering
- OneLake, OneDrive for data — Lær om Fabric's samlede datalake
- Delta Lake officiel dokumentation — Open source projektspecifikationer og funktioner