Opciones de formato de datos

Azure Databricks tiene enlaces de palabras clave integrados para todos los formatos de datos compatibles de forma nativa con Apache Spark. Azure Databricks usa Delta Lake como protocolo predeterminado para leer y escribir datos y tablas, mientras que Apache Spark usa Parquet. Las siguientes secciones describen las opciones y configuraciones disponibles cuando consultas cada formato de datos en Azure Databricks.

La mayoría de los formatos admiten la compresión de escritura mediante la compression opción . Para los valores soportados para cada formato, consulte DataFrameWriter opciones. Azure Databricks también puede leer directamente archivos comprimidos previamente en muchos formatos, y puede descomprimir archivos comprimidos en Azure Databricks si es necesario.

Para más información sobre los orígenes de datos de Apache Spark, consulte los artículos sobre funciones genéricas de carga/guardado y opciones genéricas de origen de archivo.

Formatos de tablas abiertas

Formatos de tabla que soportan transacciones ACID, evolución de esquemas e interoperabilidad entre motores.

Formato Description
Lago Delta El formato predeterminado para leer y escribir datos y tablas en Azure Databricks.
Iceberg Lee y escribe tablas de Iceberg y trabaja con motores externos de Iceberg.
OpenSharing Lee tablas y datos compartidos usando el protocolo de compartición abierta.

Formatos de columnas

Formatos columnares binarios optimizados para el rendimiento analítico de lectura y compresión.

Formato Description
Parquet El formato columnar que utiliza Apache Spark por defecto, con compresión y codificación eficientes.
ORCO Un formato columnar con compresión incorporada y soporte para índices ligeros.

Formatos basados en texto

Formatos legibles por humanos para intercambio, configuración y registros con esquemas flexibles o en evolución.

Formato Description
JSON Lee y escribe archivos JSON, incluyendo opciones para registros multilínea e inferencia de esquemas.
CSV Lee y escribe archivos de texto delimitados, con opciones para encabezados, delimitadores y registros malformados.
XML Lee y escribe archivos XML especificando la etiqueta de fila y el esquema.
Texto Lee y escribe archivos de texto plano una línea o un archivo a la vez.

Formatos binarios y especializados

Formatos de serialización binaria y fuentes de datos específicas de Azure Databricks.

Formato Description
Avro Lee y escribe archivos Avro y trabaja con cargas útiles codificadas en Avro en streaming.
Experimento de MLflow Cargue los datos de ejecución del experimento de MLflow usando la palabra clave personalizada mlflow-experiment.

Datos no estructurados

Formatos y tipos para almacenar y procesar documentos, imágenes, audio y otros archivos no estructurados.

Formato Description
Trabajar con datos no estructurados Almacena, gobierna y procesa datos no estructurados como documentos, imágenes y audio.
Binario Lee archivos como registros binarios en bruto, incluyendo imágenes y otros datos no estructurados.
Image Carga datos de imágenes para cargas de trabajo de aprendizaje automático. Databricks recomienda cargar imágenes como binary datos.
ARCHIVO Almacenar una referencia gobernada a un archivo no estructurado en lugar de usar BINARY o STRING.
Importar archivos como tipo FILE Ingiere archivos no estructurados en tablas como referencias FILE mediante SQL, funciones con valores de tabla y Auto Loader.
Archivos de proceso con UDFs Lee bytes de archivos, extrae metadatos de imágenes y vídeos, y genera archivos derivados con UDFs.
Inicio rápido de funciones FILE Empieza con el FILE tipo y sus funciones en Databricks SQL y Databricks Runtime.

Datos semiestructurados

Patrones y funciones para trabajar con datos anidados y semiestructurados en el lakehouse.

Formato Description
Modelos de datos semiestructurados Elige entre Variant, cadenas JSON, structs y mapas para almacenar datos semiestructurados.
Variant Almacenar datos semiestructurados usando el VARIANT tipo para lecturas y escrituras optimizadas.
Transformación de tipos de datos complejos Trabaja con estructuras, arrays y mapas en Apache Spark.
Funciones de orden superior Transforma arrays y mapas usando funciones de orden superior integradas.