Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Azure Databricks tiene enlaces de palabras clave integrados para todos los formatos de datos compatibles de forma nativa con Apache Spark. Azure Databricks usa Delta Lake como protocolo predeterminado para leer y escribir datos y tablas, mientras que Apache Spark usa Parquet. Las siguientes secciones describen las opciones y configuraciones disponibles cuando consultas cada formato de datos en Azure Databricks.
La mayoría de los formatos admiten la compresión de escritura mediante la compression opción . Para los valores soportados para cada formato, consulte DataFrameWriter opciones. Azure Databricks también puede leer directamente archivos comprimidos previamente en muchos formatos, y puede descomprimir archivos comprimidos en Azure Databricks si es necesario.
Para más información sobre los orígenes de datos de Apache Spark, consulte los artículos sobre funciones genéricas de carga/guardado y opciones genéricas de origen de archivo.
Formatos de tablas abiertas
Formatos de tabla que soportan transacciones ACID, evolución de esquemas e interoperabilidad entre motores.
| Formato | Description |
|---|---|
| Lago Delta | El formato predeterminado para leer y escribir datos y tablas en Azure Databricks. |
| Iceberg | Lee y escribe tablas de Iceberg y trabaja con motores externos de Iceberg. |
| OpenSharing | Lee tablas y datos compartidos usando el protocolo de compartición abierta. |
Formatos de columnas
Formatos columnares binarios optimizados para el rendimiento analítico de lectura y compresión.
| Formato | Description |
|---|---|
| Parquet | El formato columnar que utiliza Apache Spark por defecto, con compresión y codificación eficientes. |
| ORCO | Un formato columnar con compresión incorporada y soporte para índices ligeros. |
Formatos basados en texto
Formatos legibles por humanos para intercambio, configuración y registros con esquemas flexibles o en evolución.
| Formato | Description |
|---|---|
| JSON | Lee y escribe archivos JSON, incluyendo opciones para registros multilínea e inferencia de esquemas. |
| CSV | Lee y escribe archivos de texto delimitados, con opciones para encabezados, delimitadores y registros malformados. |
| XML | Lee y escribe archivos XML especificando la etiqueta de fila y el esquema. |
| Texto | Lee y escribe archivos de texto plano una línea o un archivo a la vez. |
Formatos binarios y especializados
Formatos de serialización binaria y fuentes de datos específicas de Azure Databricks.
| Formato | Description |
|---|---|
| Avro | Lee y escribe archivos Avro y trabaja con cargas útiles codificadas en Avro en streaming. |
| Experimento de MLflow | Cargue los datos de ejecución del experimento de MLflow usando la palabra clave personalizada mlflow-experiment. |
Datos no estructurados
Formatos y tipos para almacenar y procesar documentos, imágenes, audio y otros archivos no estructurados.
| Formato | Description |
|---|---|
| Trabajar con datos no estructurados | Almacena, gobierna y procesa datos no estructurados como documentos, imágenes y audio. |
| Binario | Lee archivos como registros binarios en bruto, incluyendo imágenes y otros datos no estructurados. |
| Image | Carga datos de imágenes para cargas de trabajo de aprendizaje automático. Databricks recomienda cargar imágenes como binary datos. |
| ARCHIVO | Almacenar una referencia gobernada a un archivo no estructurado en lugar de usar BINARY o STRING. |
| Importar archivos como tipo FILE | Ingiere archivos no estructurados en tablas como referencias FILE mediante SQL, funciones con valores de tabla y Auto Loader. |
| Archivos de proceso con UDFs | Lee bytes de archivos, extrae metadatos de imágenes y vídeos, y genera archivos derivados con UDFs. |
| Inicio rápido de funciones FILE | Empieza con el FILE tipo y sus funciones en Databricks SQL y Databricks Runtime. |
Datos semiestructurados
Patrones y funciones para trabajar con datos anidados y semiestructurados en el lakehouse.
| Formato | Description |
|---|---|
| Modelos de datos semiestructurados | Elige entre Variant, cadenas JSON, structs y mapas para almacenar datos semiestructurados. |
| Variant | Almacenar datos semiestructurados usando el VARIANT tipo para lecturas y escrituras optimizadas. |
| Transformación de tipos de datos complejos | Trabaja con estructuras, arrays y mapas en Apache Spark. |
| Funciones de orden superior | Transforma arrays y mapas usando funciones de orden superior integradas. |