Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Microsoft Fabric usa Delta Lake como formato de almacenamiento universal en todas las cargas de trabajo. Independientemente de si va a crear almacenes de datos, crear almacenes de lago, orquestar canalizaciones o analizar datos con Power BI, los datos se almacenan en formato Delta Lake en OneLake.
En la mayoría de los escenarios, Delta Lake funciona de forma transparente en segundo plano, no es necesario comprenderlo para usar Fabric de forma eficaz. Sin embargo, al optimizar el rendimiento, la integración con sistemas externos o la solución de problemas de escenarios entre cargas de trabajo, comprender Delta Lake le ayuda a trabajar de forma más eficaz.
¿Qué es Delta Lake?
Delta Lake es una capa de almacenamiento de código abierto que aporta confiabilidad y rendimiento a los lagos de datos. En su núcleo, Delta Lake combina dos elementos:
- Archivos Parquet : un formato de almacenamiento en columnas eficaz para el análisis.
- Registro de transacciones : registro de todos los cambios en los datos que habilitan las garantías ACID.
Esta combinación proporciona funcionalidades que el almacenamiento tradicional basado en archivos no puede ofrecer:
- Transacciones ACID: las operaciones atómicas, coherentes, aisladas y duraderas garantizan la integridad de los datos incluso cuando varios procesos leen y escriben simultáneamente
- Viaje en el tiempo: consulte los datos tal como existían en cualquier momento, revierte los errores o audite los cambios históricos.
- Evolución del esquema: agregar, quitar o modificar columnas sin volver a escribir los datos existentes
- Procesamiento por lotes y streaming unificados: procesar datos en tiempo real y por lotes con el mismo formato de tabla
Delta Lake se mantiene como un proyecto de Linux Foundation con una especificación abierta, lo que significa que funciona entre plataformas: Databricks, Azure Synapse Analytics, AWS y entornos de Apache Spark de código abierto admiten tablas de Delta Lake.
¿Por qué Fabric usa Delta Lake?
Microsoft Fabric eligió Delta Lake como formato universal para resolver un desafío fundamental: permitir que todas las cargas de trabajo compartan datos sin duplicación ni procesos ETL complejos.
OneLake + Delta Lake = fuente única de verdad
OneLake almacena todos los datos como Delta Parquet de forma predeterminada. Esta decisión arquitectónica significa:
- No hay silos de datos: una base de datos lakehouse, warehouse y KQL puede leerse desde la misma tabla Delta.
- Sin ETL entre cargas de trabajo: otros usuarios pueden leer inmediatamente los datos escritos por un motor.
- Una copia de datos: su organización mantiene una única versión de la verdad, lo que reduce los costos de almacenamiento y elimina los problemas de sincronización de datos.
Optimización del rendimiento basada en Delta
Fabric extiende Delta Lake con características de rendimiento diseñadas para la plataforma:
- V-Order: optimización de escritura específica de Fabric que reorganiza los datos para acelerar el rendimiento de las consultas en todos los motores
- Mantenimiento de tablas automáticas: Fabric puede compactar automáticamente archivos pequeños y limpiar datos antiguos
- Integración con los servicios de Fabric: Las tablas Delta funcionan perfectamente con Power BI Direct Lake, puntos de conexión de análisis SQL, canalizaciones y notebooks
Esta combinación de estándares abiertos y optimizaciones de Fabric proporciona portabilidad y rendimiento.
Comprender su trayectoria con Delta Lake
La cantidad que necesita saber sobre Delta Lake depende de lo que esté haciendo en Fabric:
Delta Lake es transparente para la mayoría de los usuarios
Si trabaja con estos escenarios, Fabric controla Delta Lake automáticamente:
- Consulta de datos mediante SQL: los endpoints de análisis SQL y los almacenes de datos ocultan Delta tras una interfaz SQL; puede consultar tablas con T-SQL sin tener que pensar en los formatos de archivo.
- Creación de informes en Power BI: Power BI Direct Lake lee las tablas Delta sin problemas para ofrecer análisis en tiempo real.
- Carga de datos con canalizaciones: la actividad de copia de Data Factory escribe en formato Delta de forma predeterminada cuando el destino son tablas de lakehouse.
Para estas experiencias, Delta Lake es un detalle de implementación que no es necesario administrar.
Le resulta beneficioso comprender Delta cuando
Algunos escenarios requieren conocimientos sobre las características de Delta Lake:
- Optimización del rendimiento de las consultas: Descripción del orden V, la compactación de tablas y las estrategias de creación de particiones le ayuda a optimizar las tablas para consultas más rápidas.
- Integración con tablas delta externas: la conexión a tablas Delta en Databricks, Snowflake, Amazon S3 u otras plataformas requiere conocimientos sobre compatibilidad de características
- Uso de características avanzadas de Spark: los vectores de eliminación, la asignación de columnas, la ampliación de tipos y la agrupación en clústeres líquidos proporcionan funcionalidades eficaces, pero necesitan una configuración explícita.
- Solución de problemas en casos entre cargas de trabajo: cuando los datos escritos por un motor no se comportan como se espera en otro, entender la compatibilidad de las características de Delta le ayuda a diagnosticar problemas.
Elección de la ruta de aprendizaje
El punto de entrada a la documentación de Delta Lake depende de su rol:
Los ingenieros de datos y los desarrolladores de Spark deben empezar con tablas de Lakehouse y Delta Lake para una cobertura completa de Delta en contextos de Spark, incluidos los patrones de optimización, el mantenimiento de tablas y las configuraciones en tiempo de ejecución.
Los usuarios de SQL y los desarrolladores de almacenes de datos deben explorar la arquitectura de Data Warehouse para comprender cómo Delta potencia capacidades del almacén de datos como los viajes en el tiempo, los clones y la conformidad con ACID.
Los desarrolladores de canalizaciones e integración de datos deben revisar el conector de Lakehouse en Data Factory para aprender cómo las canalizaciones escriben tablas Delta y administran la asignación de columnas.
Cualquiera que trabaje con distintas cargas de trabajo debe consultar la interoperabilidad del formato de tabla de Delta Lake para ver la matriz de referencia de compatibilidad de características que muestra qué funcionalidades de Delta funcionan en cada experiencia de Fabric.
Optimización y mantenimiento de tablas
Aunque Fabric controla muchas tareas de optimización automáticamente, puede mejorar el rendimiento de escenarios específicos:
- Optimización de V-Order: escriba datos con V-Order habilitado para mejorar el rendimiento de lectura en todos los motores de consulta
- Compactación de tablas: combine archivos pequeños en otros más grandes mediante comandos OPTIMIZE para reducir la sobrecarga de consultas.
- Ordenación Z: organizar los datos por columnas filtradas con frecuencia para acelerar las consultas selectivas
- Operaciones de vacío: eliminación de versiones de archivos antiguas para reducir los costos de almacenamiento
Para obtener instrucciones detalladas sobre cuándo y cómo usar estas técnicas en diferentes cargas de trabajo, consulte Mantenimiento y optimización de tablas.
Delta Lake y sistemas externos
La especificación abierta de Delta Lake permite la integración con sistemas fuera de Fabric:
- OneLake shortcuts: Referencia de tablas Delta almacenadas en Amazon S3, Azure Data Lake Storage o Databricks sin copiar datos
- Delta Sharing: comparte tablas Delta entre organizaciones mediante el protocolo abierto Delta Sharing
- Compatibilidad entre plataformas: las tablas creadas en Databricks o Azure Synapse se pueden leer en Fabric, sujeto a las limitaciones de compatibilidad de características.
Al integrar tablas delta externas, consulte la matriz de interoperabilidad feature para comprender qué características de Delta Lake son compatibles con cada experiencia Fabric.
Contenido relacionado
- Interoperabilidad del formato de tabla de Delta Lake — Matriz de compatibilidad de funciones para las capacidades de Delta en las cargas de trabajo de Fabric
- Tablas de Lakehouse y Delta Lake : guía completa para desarrolladores de Spark
- Mantenimiento y optimización de tablas : estrategias de optimización entre cargas de trabajo
- OneLake, el OneDrive de datos: obtenga información sobre el lago de datos unificado de Fabric
- Documentación oficial de Delta Lake : especificaciones y características del proyecto de código abierto