Lakehouse- ja Delta Lake -taulukot

Lakehouse Fabric:ssa käyttää Delta Lakea oletustaulukkomuotona luotettavaan, tehokkaaseen datan tallennukseen ja käsittelyyn. Vaikka muita formaatteja tuetaan, Delta Lake tarjoaa parhaan integraation Fabric-palveluiden kesken.

Mitä ovat Delta Laken pöydät?

Kun tallennat dataa Fabric Lakehouseen, data tallennetaan oletuksena Delta Lakena. Delta Lake lisää ominaisuuksia, jotka parantavat sekä suorituskykyä että luotettavuutta:

  • Parempi suorituskyky: nopeammat kyselyt ja tiedonkäsittely.
  • Tietojen luotettavuus: Transaktioiden johdonmukaisuus ja eheystarkistukset.
  • Joustavuus: Toimii sekä rakenteellisen datan (esim. taulukot) että puolistrukturoidun datan (esimerkiksi JSON) kanssa.

Miksi tämä on tärkeää?

Delta Lake on vakiotaulumuoto kaikelle datalle lakehouseissa Fabric:ssa. Tämä tarkoittaa seuraavia:

  • Johdonmukaisuus: Kaikki tiedot käyttävät samaa taulukkomuotoa.
  • yhteensopivuus: Data toimii Fabric-työkalujen, kuten Power BI:n, kannettavien ja pipelines välillä.
  • Ei ylimääräistä asetusta: Kun lataat dataa taulukoihin tai käytät muita datan latausmenetelmiä, Delta-muoto otetaan käyttöön automaattisesti.

Fabric hoitaa Delta-muotoilun kulissien takana, joten voit keskittyä mallinnukseen ja analyysiin.

Apache Spark -moottori ja dataformaatit

Lakehouseja pyörittää Apache Spark Runtime, joka jakaa perustukset Azure Synapse Analytics Runtimen kanssa Apache Sparkille. Fabric soveltaa myös erilaisia oletusasetuksia ja optimointeja, jotta Fabric-työkuormissa olisi parempi valmiin suorituskyky.

Tuetut tietomuodot:

  • Delta Lake: Suositeltu formaatti automaattisella optimoinnilla.
  • CSV: Rajattu tekstidata.
  • JSON: Puolistrukturoitu sovellus- ja verkkodata.
  • Parquet: Pakattuja pylvästiedostoja.
  • Muita muodot: AVRO ja perinteiset Hive-taulukkomuodot.

Fabric Spark -oletusten keskeiset edut:

  • Optimoitu oletuksena: Suorituskykyominaisuudet otetaan automaattisesti käyttöön paremman nopeuden saavuttamiseksi
  • Useita tuettuja formaatteja: Voit lukea olemassa olevista tiedostoista eri muodoissa
  • Automaattinen muunnos: Kun lataat dataa tauluihin, se optimoidaan automaattisesti Delta Lake -muodossa

Note

Vaikka voit työskennellä eri tiedostomuodoilla, Lakehouse Explorerissa näkyvät taulukot ovat optimoituja Delta Lake -taulukoita parhaan suorituskyvyn ja luotettavuuden takaamiseksi.

Erot Azure Synapse Analyticsiin

Jos siirryt Azure Synapse Analyticsista, tässä ovat keskeiset konfiguraatioerot Fabricin Apache Spark -ajontimessa:

Laajemman vertailun Spark-poolien, konfiguraatioiden, kirjastojen, muistikirjojen ja Spark-työn määritelmien välillä löydät Compare Fabric Data Engineering ja Azure Synapse Spark.

Apache Spark -määritys Fabric-arvo Azure Synapse Analytics value Muistiinpanot
spark.sql.sources.default delta parketti Oletustaulukkomuoto
spark.sql.parquet.vorder.default väärin* V-järjestyksen kirjoittaja
spark.sql.parquet.vorder.dictionaryPageSize 2 Gt Sanakirjan sivun koon rajoitus V-järjestyksessä
spark.databricks.delta.optimizeWrite.enabled Unset (väärin)* unsetted (epätosi) Optimoi kirjoitus

* Fabric-työtilat, jotka on luotu ennen huhtikuuta 2025, ovat oletuksena V-order ja Optimal-kirjoitus päällä. Uudemmissa työtiloissa ominaisuudet on poistettu käytöstä Fabric Spark Runtime 1.3:ssa. Ajontime 2.0:ssa Optimize Write on UNSET oletuksena.

Nämä optimoinnit on suunniteltu tarjoamaan parempaa suorituskykyä suoraan laatikosta alkaen Fabricissa. Edistyneet käyttäjät voivat tarvittaessa muokata näitä asetuksia tiettyihin tilanteisiin.

Miten Fabric löytää pöytäsi automaattisesti

Kun avaat järvitalosi, Fabric skannaa datasi automaattisesti ja näyttää löytämänsä taulukot Taulukot-osiossa Explorerissa. Tämä tarkoittaa seuraavia:

  • Manuaalista asennusta ei vaadita – Fabric löytää automaattisesti olemassa olevat taulukot
  • Organisoitu näkymä – Taulukot näkyvät puurakenteessa helpon navigoinnin vuoksi
  • Toimii pikakuvakkeilla – Taulukot, jotka on linkitty muista paikoista, löydetään myös automaattisesti

Tämä automaattinen löytö tekee kaikkien saatavilla olevien tietojen näkemisestä helposti yhdellä silmäyksellä.

Käytä pikakuvakkeita taulukoiden ja tiedostojen kanssa

OneLaken pikakuvakkeet voivat osoittaa Delta-taulukoihin tai tiedosto- ja kansiopolkuihin, joten voit viitata ulkoiseen dataan ilman, että sitä tarvitsee siirtää. Seuraava taulukko tiivistää suositellut mallit kohdedatatyypin perusteella.

Tietotyyppi pikakuvakkeen kohteessa Pikakuvakkeen luontipaikka Parhaat käytännöt
Delta Lake -taulukko Tables osa Jos kohdesijainnissa on useita taulukoita, luo yksi pikakuvake taulukkoa kohti.
Tiedostoja sisältäviä kansioita Files osa Käytä Apache Sparkia suhteellisilla poluilla lukeaksesi suoraan pikakuvakkeen kohteesta. Lataa lakehouse-alkuperäisiin Delta-taulukoihin maksimaalisen suorituskyvyn saavuttamiseksi.
Vanhat Apache Hive -taulukot Files osa Käytä Apache Sparkia suhteellisilla poluilla tai luo metatietoluettelon viite käyttäen CREATE EXTERNAL TABLE. Lataa lakehouse-alkuperäisiin Delta-taulukoihin maksimaalisen suorituskyvyn saavuttamiseksi.

Lataa taulukoihin

Lakehouset tarjoavat visuaalisen kokemuksen yleisten tiedostomuotojen lataamiseen Delta-tauluihin. Lisätietoja saat kohdasta Load to Delta Lake -taulukot.

Pöytien nopeana ja tehokkaana pitäminen

Fabric optimoi automaattisesti Delta Lake -taulukot paremman suorituskyvyn saavuttamiseksi, mutta joskus saatat tarvita lisähallintaa:

Mitä Fabric tekee automaattisesti:

  • Yhdistää pienet tiedostot suuremmiksi ja tehokkaammiksi tiedostoiksi
  • Optimoi datan asettelun nopeampiin kyselyihin
  • Hallinnoi storage kustannusten vähentämiseksi

Kun saatat tarvita manuaalista optimointia:

  • Erittäin suuret aineistot, joilla on erityiset suorituskykyvaatimukset
  • Mukautetut datan järjestelytarpeet
  • Edistyneet analytiikkaskenaariot

Yksityiskohtaiset ohjeet taulukon optimointiin löytyvät Delta Lake -taulukon optimointi ja V-järjestys.