Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
SQL analytics-endpointet er en læseoptimeret, T-SQL-overflade over Delta-data i Fabric. Denne artikel forklarer Fabric-datalagerarbejdsbyrden med SQL-analyse-endpointet for lakehouse'en og scenarier for brug af lakehouse i data warehousing.
Hvad er et Lakehouse SQL analytics-endpoint?
SQL analytics-endpointet gør det muligt at forespørge data i lakehouse ved at bruge T-SQL-sproget og TDS-protokollen.
- SQL-analyse-endpointet eksponerer Delta-tabeller fra lakehouse som SQL-tabeller, som du kan forespørge med T-SQL.
- Hvert delta-bord fra et søhus er repræsenteret som ét bord. Dataene skal være i deltaformat.
- Hver lakehouse har ét SQL-analyseendpoint, og hvert arbejdsområde kan have mere end én lakehouse. Andre Fabric-elementer – herunder lagre, spejlede databaser, SQL-databaser og Azure Cosmos DB – provisionerer også automatisk et SQL-analyse-endpoint, så et arbejdsområde kan have flere SQL-analyse-endpoints end lakehouse-elementer.
Du behøver ikke oprette et SQL-analyse-endpoint i Fabric. Der oprettes automatisk et SQL Analytics-slutpunkt for alle lakehouse-, database- eller spejlede databaser. Et SQL-analyse-endpoint fungerer som en letvægts datalagerkapacitet for deres overordnede elementer og supplerer lagerets lakehouse-arkitektur. Denne arkitektur tillader Spark- eller Fabric-spejling at kontrollere data i en mappestruktur i lakehouse, som SQL-analyse-endpointet kan se.
Bemærkning
Bag kulisserne bruger SQL-analyse-endpointet samme motor som Warehouse til at levere højtydende, lav-latenstid SQL-forespørgsler.
Automatisk metadataopdagelse
En sømløs proces læser Delta-loggene fra /Tables mappen og sikrer, at SQL-metadata for tabeller, såsom statistik, altid er opdateret. Der kræves ingen brugerhandling, og det er ikke nødvendigt at importere, kopiere data eller konfigurere infrastruktur. Du kan finde flere oplysninger under Automatisk genereret skema i SQL Analytics-slutpunktet.
Scenarier, som lakehouse muliggør til datalagring
I Fabric tilbyder vi ét lager.
Lakehouse, med sit SQL-analyse-endpoint, drevet af lageret, kan forenkle det traditionelle beslutningstræ med batch-, streaming- eller lambda-arkitekturmønstre. Lakehouse muliggør sammen med et lager mange scenarier med additive analyser. Dette afsnit undersøger, hvordan man bruger et søhus sammen med et lager til en bedst mulig analysestrategi.
Analyse med dit lakehouses guldlag
En velkendt strategi for lake data-organisering er medallionarkitektur. Denne strategi organiserer filer i rå (bronze), konsoliderede (sølv) og raffinerede (guld) lag. Du kan bruge et SQL-analyse-endpoint til at analysere data i det gyldne lag af medallion-arkitekturen, hvis filerne er gemt i Delta Lake-format, selvom de er lagret uden for Microsoft Fabric OneLake.
Brug genveje i OneLake til at referere til gold-mapper i eksterne Azure Data Lake-lagringskonti, som Azure Synapse Spark eller Azure Databricks-motorer administrerer.
Du kan også tilføje lagre som fagområde- eller domæneorienterede løsninger til specifikke emner, der kan have skræddersyede analysekrav.
Hvis du vælger at beholde dine data i Fabric, er de altid åbene og tilgængelige via API'er, Delta-format og selvfølgelig T-SQL.
Forespørg som en tjeneste over dine Delta-tabeller fra lakehouse og andre elementer fra OneLake
Analytikere, data scientists og data engineers kan have brug for at forespørge data inden for en data lake. I Fabric er denne end-to-end-oplevelse fuldstændig SaaSificeret.
OneLake er en enkelt, samlet og logisk datasø for hele organisationen. OneLake er OneDrive for data. OneLake kan indeholde flere arbejdsområder, f.eks. langs dine organisationsafdelinger. Hver eneste enhed i Fabric gør data tilgængelige via OneLake.
Data i et lakehouse i Fabric lagres fysisk i OneLake med følgende mappestruktur:
- Mappen
/Filesindeholder rå og ukonsoliderede (bronze) filer, som dataingeniører bør behandle før analyse. Filerne kan være i forskellige formater såsom CSV, Parquet, forskellige typer billeder og mere. - Mappen
/Tablesindeholder raffinerede og konsoliderede (guld) data, der er klar til forretningsanalyse. De konsoliderede data er i Delta Lake-format.
Et SQL Analytics-slutpunkt kan læse data i mappen /tables i OneLake. Analyse er så simpelt som at forespørge SQL-analyse-endpointet i lakehouse. Sammen med lageret får du også krydsdatabaseforespørgsler og mulighed for problemfrit at skifte fra skrivebeskyttede forespørgsler til at bygge ekstra forretningslogik oven på dine OneLake-data med Fabric data warehouse.
Dataudvikler med Spark og Servering med SQL
Datadrevne virksomheder skal holde deres back end- og analysesystemer i næsten realtidssynkronisering med kundeorienterede programmer. Virkningen af transaktioner skal afspejles nøjagtigt via komplette processer, relaterede programmer og OLTP-systemer (online transaction processing).
I Fabric kan du bruge Spark Streaming eller Dataudvikler til at organisere dine data. Du kan bruge lakehouse SQL analytics-endpointet til at validere datakvalitet og for eksisterende T-SQL-processer. Dette kan gøres i en medaljonarkitektur eller i flere lag af dit søhus, hvor der serveres bronze, sølv, guld eller iscenesættelse, kuraterede og forfinede data. Du kan tilpasse de mapper og tabeller, der oprettes via Spark, så de opfylder dine datatekniske og forretningsmæssige krav. Når det er klart, kan et lager levere alle dine downstream business intelligence-applikationer og andre analyse-anvendelser uden at kopiere data, bruge Views eller forfine data med CREATE TABLE AS SELECT (CTAS), stored procedures og andre DML/DDL-kommandoer.
Integration med dit åbne søhus guldlag
Et SQL-analyse-endpoint er ikke begrænset til dataanalyse i kun lakehouse i Fabric. Ved at bruge et SQL analytics-endpoint kan du analysere lake-data i ethvert lakehouse ved at bruge Azure Synapse Spark, Azure Databricks eller en anden lake-centreret data engineering-motor. Du kan gemme dataene i Azure Data Lake Storage eller Amazon S3.
Du kan altid få adgang til denne tætte, tovejsintegration med lakehouse i Fabric via enhver engine ved at bruge åbne API'er, Delta-formatet og selvfølgelig T-SQL.
Datavirtualisering af eksterne datasøer med genveje
Brug OneLake-genveje til at referere til guldmapper i eksterne Azure Data Lake-lagringskonti, som Azure Synapse Spark eller Azure Databricks-motorer administrerer, samt enhver Delta-tabel gemt i Amazon S3.
Du kan analysere enhver mappe, der refereres til via en genvej fra et SQL-analyse-endpoint, og oprette en SQL-tabel for de refererede data. Brug SQL-tabellen til at eksponere data i eksternt administrerede datalakes og aktiver analyse på dem.
Denne genvej fungerer som et virtuelt lager, som du kan udnytte fra et lager til yderligere downstream-analysebehov eller foretage direkte forespørgsler.
For at analysere data i eksterne datalake-lagringskonti skal følgende trin bruges:
- Opret en genvej, der refererer til en mappe i Azure Data Lake-lageret eller Amazon S3-konto. Efter du har indtastet forbindelsesoplysninger og legitimationsoplysninger, vises en genvej i søhuset.
- Skift til SQL-analyse-endpointet i lakehouse og find en SQL-tabel med et navn, der matcher genvejsnavnet. Denne SQL-tabel refererer til mappen i ADLS eller S3.
- Forespørg SQL-tabellen, der refererer til data i ADLS eller S3. Brug tabellen, som du ville bruge enhver anden tabel i SQL-analyse-endpointet. Du kan joinforbinde tabeller, der refererer til data i forskellige lagerkonti.
Bemærkning
Hvis SQL-tabellen ikke straks vises i SQL analytics-endpointet, så vent et par minutter. Den SQL-tabel, der refererer til data i en ekstern lagerkonto, oprettes med en forsinkelse.
Analyser arkiverede eller historiske data i en datalake
Datapartitionering er en velkendt teknik til optimering af dataadgang i datasøer. Gem partitionerede datasæt i hierarkiske mappestrukturer i formatet /year=<year>/month=<month>/day=<day>, hvor year, month, og day er partitioneringskolonnerne. Denne struktur holder historiske data logisk adskilt og gør det muligt for beregningsmotorer at læse dataene efter behov med performant filtrering, i stedet for at læse hele mappen og alle mapper og filer indeni.
Partitionerede data muliggør hurtigere adgang, hvis forespørgslerne filtreres på de prædikater, der sammenligner prædikatkolonner med en værdi.
Et SQL Analytics-slutpunkt kan nemt læse denne type data uden konfiguration påkrævet. Du kan f.eks. bruge et hvilket som helst program til at arkivere data i en data lake, herunder SQL Server 2022 eller Azure SQL Managed Instance. Efter du har partitioneret data og placeret dem i en sø til arkiveringsformål ved hjælp af eksterne tabeller, kan et SQL-analyse-endpoint læse partitionerede Delta Lake-tabeller som SQL-tabeller og lade din organisation analysere dem. Denne tilgang reducerer de samlede ejeromkostninger, reducerer datadubblering og lyser op for big data, AI og andre analysescenarier.
Du kan også bruge tidsrejseforespørgsler til hurtigt at forespørge tidligere versioner af data. Tidsrejser er en lavpris og effektiv mulighed for at forespørge tidligere datatilstande med T-SQL-forespørgsler. For et Lakehouse SQL-analyse-endpoint er tidsrejser begrænset af indstillinger for vakuumopbevaring. For at komme i gang, se Sådan gør du: Forespørgsel ved hjælp af tidsrejser på sætningsniveau.
Datavirtualisering af Fabric-data med genveje
I Fabric giver arbejdsområder dig mulighed for at adskille data baseret på komplekse forretnings-, geografiske eller lovmæssige krav.
Et SQL-analyse-endpoint gør det muligt at lade dataene blive på plads og stadig analysere data i lageret eller ved søen, selv i andre Fabric-arbejdsområder, via en sømløs virtualisering. Hvert søhus i Fabric gemmer data i OneLake.
Genveje giver dig mulighed for at referere til mapper på en vilkårlig OneLake-placering.
Hvert lager i Fabric gemmer tabeldata i OneLake. Hvis en tabel kun tilføjes, vises tabeldataene som Delta Lake-data i OneLake. Genveje gør det muligt at henvise til mapper i enhver OneLake, hvor lagertabellerne er eksponeret.
Deling og forespørgsel på tværs af arbejdsområder
Arbejdsområder giver dig mulighed for at adskille data baseret på komplekse forretnings-, geografiske eller lovmæssige krav, men nogle gange er du nødt til at gøre det nemmere at dele på tværs af disse linjer til specifikke analysebehov.
Et lakehouse SQL-analyse-endpoint kan muliggøre nem deling af data mellem afdelinger og brugere, hvor en bruger kan medbringe sin egen kapacitet og lager. Arbejdsområder organiserer afdelinger, forretningsenheder eller analytiske domæner. Ved at bruge genveje kan brugere finde data fra ethvert lager eller lakehouse. Brugerne kan straks udføre deres egne brugerdefinerede analyser fra de samme delte data. Ud over at hjælpe med afdelingsmæssige chargebacks og brugsfordeling, er denne tilgang en nulkopiversion af dataene.
SQL Analytics-slutpunktet gør det muligt at forespørge på en hvilken som helst tabel og nemt at dele. Du kan tilføje kontroller ved at bruge workspace-roller og sikkerhedsroller for at opfylde yderligere forretningskrav.
For at muliggøre dataanalyse på tværs af arbejdsområder, brug følgende trin:
- Opret en OneLake-genvej, der refererer til en tabel eller en mappe i et arbejdsområde, som du har adgang til.
- Vælg et lakehouse eller lager, der indeholder en tabel eller en Delta Lake-mappe, som du vil analysere. Når du vælger en tabel eller mappe, vises en genvej i søhuset.
- Skift til SQL-analyse-endpointet i lakehouse og find SQL-tabellen, der har et navn, der matcher genvejsnavnet. Denne SQL-tabel refererer til mappen i et andet arbejdsområde.
- Forespørg den SQL-tabel, der refererer til data i et andet arbejdsområde. Du kan bruge tabellen, som du ville bruge enhver anden tabel i SQL-analyse-endpointet. Du kan joinforbinde de tabeller, der refererer til data i forskellige arbejdsområder.
For mere information om sikkerhed i SQL-analyse-endpoints, se OneLake security for SQL analytics endpoints.
Bemærkning
Hvis SQL-tabellen ikke straks vises i SQL analytics-endpointet, så vent et par minutter. Den SQL-tabel, der refererer til data i et andet arbejdsområde, oprettes med en forsinkelse.
Analysér partitionerede data
Datapartitionering er en velkendt teknik til optimering af dataadgang i datasøer. Du gemmer opdelte datasæt i hierarkiske mappestrukturer i formatet /year=<year>/month=<month>/day=<day>, hvor year, month, og day er partitioneringskolonnerne. Partitionerede datasæt muliggør hurtigere dataadgang, hvis forespørgslerne bruger prædikater, der filtrerer data ved at sammenligne prædikatkolonner med en værdi.
Et SQL Analytics-slutpunkt kan repræsentere partitionerede Delta Lake-datasæt som SQL-tabeller og give dig mulighed for at analysere dem.
For mere information og eksempler på forespørgsel af eksterne data, se Forespørg eksterne data lake-filer ved at bruge Fabric data warehouse eller SQL analytics endpoint. For et eksempel og en brugsscenarie for forespørgsler af partitionerede parquet-filer, se Forespørgsel partitionerede data.
Analyser data i søhuset, lageret eller eventhuset
Lakehouse- og Warehouse-hovedsiderne inkluderer Eventhouse-endpointet som en del af menuen Analyze data with . Eventhouse-endpointet leverer en Eventhouse-drevet forespørgselsoplevelse direkte oven på Lakehouse- og Warehouse-data uden dataduplikering eller manuel synkronisering.
Når du aktiverer Eventhouse-endpointet, oprettes en Eventhouse og en KQL-database automatisk som underenheder af kilde-Lakehouse eller Warehouse, med skema-synkronisering håndteret i baggrunden. Endepunktet afspejler altid det aktuelle skema for kildedataene, hvilket muliggør næsten realtids analytisk adgang.
Denne integration gør Eventhouse til en naturlig forlængelse af datakilden, snarere end et separat system, du skal opsætte og administrere. For mere information om Eventhouse Endpoint, se Enable Eventhouse endpoint for lakehouse og warehouse.
Relateret indhold
- Hvad er et søhus i Fabric?
- Fabric beslutningsguide: Vælg mellem lager og lakehouse
- Tag dine data med til OneLake med lakehouse
- Power BI semantiske modeller i Fabric
- Muligheder for at få data ind i søhuset i Fabric
- Sådan kopierer du data ved hjælp af kopiaktivitet
- Flyt data fra Azure SQL DB til lakehouse via copy assistant
- Forbindelse til datalagring i Fabric
- SQL Analytics-slutpunktet for lakehouse
- Forespørg SQL-analyse-endpointet eller lageret i Fabric