Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Microsoft Purview supporta la valutazione della qualità dei dati sugli asset di dati Apache Iceberg. È possibile gestire, gestire ed analizzare i dati iceberg in queste origini di archiviazione:
- Azure Data Lake Storage Gen2
- Microsoft Fabric Lakehouse
- Amazon Web Services (AWS) S3
- Google Cloud Platform (GCP) Cloud Storage (GCS)
Questo articolo illustra la struttura dei file Iceberg, illustra come configurare le analisi della qualità dei dati ed elenca i suggerimenti per ogni catalogo e tipo di archiviazione.
Struttura del file Iceberg
Una tabella Iceberg è più di una semplice raccolta di file di dati. Include vari file di metadati che tengono traccia dello stato della tabella e facilitano operazioni come letture, scritture ed evoluzione dello schema. Una tabella Iceberg include un catalogo, un livello di metadati e un livello dati. I file di dati in una tabella Iceberg vengono in genere archiviati in formati columnar come Apache Parquet, Apache Avro o Apache Optimized Row Columnar (ORC). Questi file contengono i dati effettivi con cui gli utenti interagiscono durante le query.
Panoramica del livello catalogo
Il catalogo Iceberg si trova all'inizio della gerarchia. Archivia il puntatore dei metadati corrente per ogni tabella. Il catalogo consente di tenere traccia dello stato più recente di una tabella facendo riferimento al file di metadati corrente.
Panoramica del livello metadati
Il livello dei metadati è fondamentale per la funzionalità di Iceberg. Include questi elementi chiave:
- File di metadati: Contiene informazioni sullo schema, il partizionamento e gli snapshot della tabella. Nel diagramma s0 fa riferimento a uno snapshot, un record dello stato della tabella in un determinato momento. Se sono presenti più snapshot, ad esempio s0 e s1, il file di metadati tiene traccia di entrambi.
- Elenco manifesto: Punta a uno o più file manifesto. Un elenco di manifesti funge da contenitore di riferimenti a questi manifesti. Consente a Iceberg di gestire i file di dati da leggere o scrivere durante operazioni diverse. Ogni snapshot potrebbe avere un proprio elenco di manifesti.
Panoramica del livello dati
Nel livello dati, i file manifesto fungono da intermediario tra i metadati e i file di dati effettivi. Ogni file manifesto punta a una raccolta di file di dati, fornendo una mappa dei file fisici archiviati nel data lake.
- File manifesto: archiviare i metadati per un gruppo di file di dati, inclusi i conteggi delle righe, le informazioni di partizione e i percorsi dei file. Consentono a Iceberg di eliminare e accedere rapidamente a file specifici.
- File di dati: contengono i dati effettivi, archiviati in formati come Parquet, ORC o Avro. Iceberg organizza i file di dati in base alle partizioni, riducendo al minimo le analisi dei dati non necessarie durante l'esecuzione delle query.
Funzionamento dei componenti Iceberg
Quando si eseguono query o si aggiornano i dati, Iceberg cerca il file di metadati della tabella tramite il catalogo. Il file di metadati fa riferimento allo snapshot corrente (o a più snapshot). Ogni snapshot punta a un elenco di manifesti, che fa riferimento ai file manifesto. I file manifesto elencano i file di dati. Questa ricerca a più livelli consente a Iceberg di gestire set di dati di grandi dimensioni mantenendo coerenti le letture e le scritture. I lettori e i writer visualizzano sempre uno stato di tabella coerente. La progettazione basata su snapshot consente anche il time travel (esecuzione di query sugli stati di tabella precedenti) e l'evoluzione dello schema.
Lo stesso approccio a più livelli aumenta le prestazioni per le operazioni batch e di streaming. Vengono letti solo i file di dati necessari e gli aggiornamenti usano gli snapshot senza modificare il set di dati completo.
Dati iceberg in OneLake
Importante
Anche i dati Iceberg in AWS S3 e GCS devono essere sincronizzati automaticamente come Delta per curare, gestire e misurare e monitorare la qualità dei dati.
È possibile utilizzare facilmente i dati in formato Iceberg in Microsoft Fabric senza spostamento o duplicazione dei dati. Usare i tasti di scelta rapida di OneLake per puntare direttamente a un livello dati.
I dati iceberg vengono archiviati in OneLake e scritti usando Snowflake o un altro writer Iceberg. OneLake virtualizza la tabella come tabella Delta Lake, che garantisce un'ampia compatibilità tra i motori di Fabric. Ad esempio, è possibile creare un volume in Snowflake e puntarlo direttamente a Fabric Lakehouse. Dopo aver creato la tabella Iceberg in OneLake, la sincronizzazione automatica riflette gli aggiornamenti dei dati in tempo reale. Per altre informazioni, vedere Configurare un volume esterno Iceberg per Azure nella documentazione di Snowflake.
Qualità dei dati per i dati Iceberg
Per tutti gli utenti che idratano in modo nativo i dati in Iceberg in Parquet, ORC o Avro in Data Lake Storage Gen2 o Fabric Lakehouse, configurare un'analisi che punta alla posizione della directory che ospita le directory iceberg dei dati e dei metadati. Per configurare il supporto della qualità dei dati Iceberg, completare questa procedura:
- Configurare ed eseguire un'analisi in Microsoft Purview Data Map.
- Configurare la directory che ospita dati e metadati come asset di dati e associarla a un prodotto dati. L'associazione della directory come asset di dati e il collegamento a un prodotto dati costituisce il set di dati Iceberg. Informazioni su come associare asset di dati a un prodotto dati.
- In Unified Catalog, in Gestione integrità selezionare Data quality view per trovare i file Iceberg (asset di dati) e per configurare la connessione all'origine dati.
- Per configurare una connessione Data Lake Storage Gen2, seguire la procedura descritta in Configurare la connessione all'origine dati per la qualità dei dati.
- Per configurare una connessione OneLake di Fabric, seguire la procedura descritta in Configurare la qualità dei dati per i dati di Fabric Lakehouse.
- Nella pagina Schema del file Iceberg selezionato (asset di dati) selezionare Importa schema per importare lo schema dall'origine dati.
- Nella pagina Panoramica del file Iceberg selezionare Iceberg dal menu a discesa Asset dati.
- Applicare regole di qualità dei dati ed eseguire analisi della qualità dei dati per l'assegnazione dei punteggi di qualità dei dati a livello di colonna e di tabella.
Profilatura e analisi della qualità dei dati
Importante
Prima di eseguire la profilatura dei dati o le analisi della qualità dei dati, è necessario recuperare e impostare lo schema dalla pagina Schema data quality. I consumer non visualizzano lo schema nella visualizzazione asset di dati perché Mappa dati non supporta ancora il formato di tabella aperta Iceberg. Gli amministratori di Data Quality possono importare lo schema dalla pagina Dello schema Data Quality.
Dopo aver completato la configurazione della connessione e la selezione del formato del file di asset di dati, è possibile profilare i dati, creare e applicare regole ed eseguire un'analisi della qualità dei dati nei file di formato aperto Iceberg. Per istruzioni dettagliate, vedere gli articoli seguenti:
- Configurare ed eseguire la profilatura dei dati per un asset di dati
- Configurare ed eseguire un'analisi della qualità dei dati
Importante
Il supporto per il formato aperto Iceberg nelle funzionalità di individuazione, cura, profilatura dei dati e analisi della qualità dei dati è disponibile in anteprima.
Limitazioni correnti per la qualità dei dati Iceberg
La versione di anteprima corrente di Microsoft Purview supporta solo i dati creati in formato Iceberg con il catalogo Apache Hadoop (un'implementazione del catalogo basata su file). Gli scenari del catalogo Snowflake sono supportati solo tramite la virtualizzazione Delta usando i collegamenti onelake.
Percorso lakehouse e percorso Data Lake Storage Gen2
I metadati iceberg archivia il percorso completo per i dati e i metadati. Assicurarsi di usare il percorso completo per Data Lake Storage Gen2 e Fabric Lakehouse. Inoltre, per il percorso di Fabric Lakehouse durante la scrittura, assicurarsi di funzionare (WRITES, UPSERTS) con i percorsi ID. Nell'esempio seguente viene illustrato il formato di percorso ABFSS necessario. Sostituire
<filesystem-ID>e<lakehouse-ID>con i GUID effettivi:abfss://<filesystem-ID>@onelake.dfs.fabric.microsoft.com/<lakehouse-ID>/Files/CustomerDataFile system come ID e Lakehouse come ID. I percorsi assoluti e non relativi sono necessari affinché Microsoft Purview esegua la qualità dei dati in Iceberg. Per convalidare, assicurarsi di controllare il percorso degli snapshot in modo che punti come percorsi completi del nome completo (FQN).
Rilevamento dello schema
- Mappa dati non è in grado di rilevare lo schema Iceberg. Quando si curano le directory iceberg in Fabric Lakehouse o Data Lake Storage Gen2, non è possibile esaminare lo schema. Tuttavia, lo schema di recupero della qualità dei dati può eseguire il pull dello schema per l'asset curato.
Raccomandazioni per la configurazione della qualità dei dati iceberg
Scegliere l'approccio che corrisponde al catalogo e all'archiviazione:
| Origine/Catalogo | Archiviazione | Approccio | Formati supportati |
|---|---|---|---|
| Catalogo Snowflake | Data Lake Storage Gen2, AWS S3 o GCP GCS (VOLUME) | Usare un collegamento a OneLake Table di Fabric. Eseguire la qualità dei dati come tabella Delta. | Solo Parquet |
| Catalogo Hadoop | Data Lake Storage Gen2 | Analizzare direttamente la directory. Usare il motore Iceberg per la qualità dei dati. | Parquet, ORC, Avro |
| Fiocco di neve | Fabric Lakehouse (VOLUME puntato a Lakehouse) | Usare OneLake Table per creare una versione compatibile con Delta. | Solo Parquet |
| Catalogo Hadoop | Fabric Lakehouse | Analizzare direttamente la directory Lakehouse. Usare il motore Iceberg per la qualità dei dati. | Parquet, ORC, Avro |
Risorse correlate
Questi articoli illustrano la configurazione e l'analisi della qualità dei dati:
- Configurare la connessione all'origine dati per la qualità dei dati
- Configurare ed eseguire la profilatura dei dati per un asset di dati
- Configurare ed eseguire un'analisi della qualità dei dati
- Configurare la qualità dei dati per le origini dati di collegamento a Fabric Lakehouse
- Risoluzione dei problemi relativi alla qualità dei dati