Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Ein Lakehouse in Fabric verwendet Delta Lake als Standardtabellenformat für zuverlässige, leistungsstarke Datenspeicherung und -verarbeitung. Während andere Formate unterstützt werden, bietet Delta Lake die beste Integration in Fabric-Dienste.
Was sind Delta Lake-Tabellen?
Wenn Sie Daten in einem Fabric Lakehouse speichern, werden die Daten standardmäßig als Delta Lake gespeichert. Delta Lake fügt Funktionen hinzu, die sowohl Leistung als auch Zuverlässigkeit verbessern:
- Bessere Leistung: Schnellere Abfragen und Datenverarbeitung.
- Datensicherheit: Transaktionskonsistenz- und Integritätsprüfungen.
- Flexibilität: Funktioniert sowohl mit strukturierten Daten (z. B. Tabellen) als auch mit halbstrukturierten Daten (z. B. JSON).
Warum ist dies wichtig?
Delta Lake ist das Standardtabellenformat für alle Daten in Seehäusern in Fabric. Dies bedeutet:
- Konsistenz: Alle Daten verwenden dasselbe Tabellenformat.
- Compatibility: Daten funktionieren über Fabric-Tools wie Power BI, Notizbücher und pipelines hinweg.
- Kein zusätzliches Setup: Wenn Sie Daten in Tabellen laden oder andere Methoden zum Laden von Daten verwenden, wird das Delta-Format automatisch angewendet.
Fabric behandelt die Delta-Formatierung hinter den Kulissen, sodass Sie sich auf modellierung und Analyse konzentrieren können.
Apache Spark-Modul und Datenformate
Lakehouses werden von Apache Spark Runtime betrieben, das die Grundlagen mit Azure Synapse Analytics Runtime für Apache Spark teilt. Fabric wendet außerdem unterschiedliche Standardwerte und Optimierungen an, um die sofortige Leistung der Fabric-Workloads zu verbessern.
Unterstützte Datenformate:
- Delta Lake: Bevorzugtes Format mit automatischer Optimierung.
- CSV: Durch Trennzeichen getrennte Textdaten.
- JSON: Semistrukturierte Anwendungs- und Webdaten.
- Parquet: Komprimierte spaltenbasierte Dateien.
- Andere Formate: AVRO- und legacy-Hive-Tabellenformate.
Die wichtigsten Vorteile der Standardwerte von Fabric Spark:
- Standardmäßig optimiert: Leistungsfeatures werden automatisch für eine bessere Geschwindigkeit aktiviert.
- Mehrere unterstützte Formate: Sie können aus vorhandenen Dateien in verschiedenen Formaten lesen.
- Automatische Konvertierung: Wenn Sie Daten in Tabellen laden, wird sie automatisch mit dem Delta Lake-Format optimiert.
Hinweis
Während Sie mit verschiedenen Dateiformaten arbeiten können, sind die Tabellen, die im Lakehouse-Explorer angezeigt werden, optimierte Delta-Lake-Tabellen für die beste Leistung und Zuverlässigkeit.
Unterschiede von Azure Synapse Analytics
Wenn Sie von Azure Synapse Analytics migrieren, finden Sie hier die wichtigsten Konfigurationsunterschiede in der Apache Spark-Laufzeit von Fabric:
Einen umfassenderen Vergleich zwischen Spark-Pools, Konfigurationen, Bibliotheken, Notizbüchern und Spark-Auftragsdefinitionen finden Sie unter Compare Fabric Data Engineering und Azure Synapse Spark.
| Apache Spark-Konfiguration | Fabric-Wert | Wert von Azure Synapse Analytics | Hinweise |
|---|---|---|---|
| spark.sql.sources.default | Delta | Parkett | Standardtabellenformat |
| spark.sql.parquet.vorder.default | FALSE* | – | V-Order-Schreiber |
| spark.sql.parquet.vorder.dictionaryPageSize | 2 GB | – | Wörterbuch-Seitengrößenbeschränkung für V-Ordnung |
| spark.databricks.delta.optimizeWrite.enabled | nicht gesetzt (false)* | Nicht festgelegt (false) | Schreibvorgang optimieren |
* Fabric-Arbeitsbereiche, die vor April 2025 erstellt wurden, haben standardmäßig V-Order und Optimize write aktiviert. Neuere Arbeitsbereiche haben die Features in Fabric Spark Runtime 1.3 deaktiviert. In Runtime 2.0 ist Optimize Write standardmäßig UNSET.
Diese Optimierungen sind darauf ausgelegt, in Fabric sofort einsatzbereit eine bessere Leistung bereitzustellen. Erweiterte Benutzer können diese Konfigurationen bei Bedarf für bestimmte Szenarien ändern.
Wie Fabric Ihre Tabellen automatisch findet
Wenn du dein Seehaus öffnest, scannt Fabric automatisch deine Daten und zeigt alle Tabellen an, die es im Tabellenbereich des Explorers findet. Dies bedeutet:
- Kein manuelles Setup erforderlich – Fabric ermittelt automatisch vorhandene Tabellen.
- Organisierte Ansicht – Tabellen werden in einer Struktur angezeigt, um eine einfache Navigation zu ermöglichen.
- Arbeitet mit Tastenkombinationen – Auch Tabellen, die von anderen Speicherorten verknüpft sind, werden automatisch ermittelt.
Diese automatische Ermittlung erleichtert das Anzeigen aller verfügbaren Daten auf einen Blick.
"Shortcuts mit Tabellen und Dateien verwenden"
OneLake-Verknüpfungen können auf Delta-Tabellen oder Datei- und Ordnerpfade verweisen, sodass Sie auf externe Daten verweisen können, ohne sie zu verschieben. In der folgenden Tabelle werden empfohlene Muster basierend auf dem Zieldatentyp zusammengefasst.
| Datentyp am Verknüpfungsziel | Wo die Verknüpfung erstellt wird | Bewährte Vorgehensweise |
|---|---|---|
| Delta Lake-Tabelle |
Tables Abschnitt |
Wenn mehrere Tabellen im Ziel vorhanden sind, erstellen Sie eine Verknüpfung pro Tabelle. |
| Ordner mit Dateien |
Files Abschnitt |
Verwenden Sie Apache Spark mit relativen Pfaden, um direkt aus dem Symlink-Ziel zu lesen. Laden Sie in Delta-Tabellen aus Lakehouse-Umgebungen für maximale Leistung. |
| Apache Hive-Legacytabellen |
Files Abschnitt |
Verwenden Sie Apache Spark mit relativen Pfaden, oder erstellen Sie einen Metadatenkatalogverweis mithilfe von CREATE EXTERNAL TABLE. Laden Sie in Delta-Tabellen aus Lakehouse-Umgebungen für maximale Leistung. |
In Tabellen laden
Lakehouses bieten ein visuelles Erlebnis, um gängige Dateiformate in Delta-Tabellen zu laden. Weitere Informationen finden Sie in den Tabellen "Load to Delta Lake".
Schnelle und effiziente Pflege Ihrer Tabellen
Fabric optimiert Ihre Delta Lake-Tabellen automatisch für eine bessere Leistung, aber manchmal möchten Sie möglicherweise zusätzliche Kontrolle:
Was Fabric automatisch macht:
- Kombiniert kleine Dateien in größere, effizientere Dateien
- Optimiert das Datenlayout für schnellere Abfragen.
- Verwaltet Speicher, um Kosten zu senken
Wenn Sie möglicherweise eine manuelle Optimierung benötigen:
- Sehr große Datasets mit bestimmten Leistungsanforderungen
- Anforderungen der benutzerdefinierten Datenorganisation
- Erweiterte Analyseszenarien
Für ausführliche Hinweise zur Tabellenoptimierung siehe Delta Lake Tabellenoptimierung und V-Ordnung.