Opções de formato de dados

O Azure Databricks tem ligações de palavras-chave incorporadas para todos os formatos de dados suportados nativamente pelo Apache Spark. O Azure Databricks usa o Delta Lake como o protocolo padrão para ler e gravar dados e tabelas, enquanto o Apache Spark usa o Parquet. As secções seguintes descrevem as opções e configurações disponíveis quando consulta cada formato de dados no Azure Databricks.

A maioria dos formatos suporta compressão de escrita através desta compression opção. Para os valores suportados para cada formato, consulte DataFrameWriter opções. O Azure Databricks também pode ler diretamente ficheiros pré-comprimidos em muitos formatos, e pode descompactar ficheiros comprimidos no Azure Databricks, se necessário.

Para obter mais informações sobre origens de dados do Apache Spark, veja Funções Genéricas de Carregar/Guardar e Opções Genéricas de Origem de Ficheiro.

Formatos de tabela aberta

Formatos de tabela que suportam transações ACID, evolução de esquemas e interoperabilidade entre motores.

Format Description
Lago Delta O formato padrão para ler e escrever dados e tabelas no Azure Databricks.
Iceberg Ler e escrever tabelas Iceberg e interoperar com motores Iceberg externos.
OpenSharing Leia tabelas e dados partilhados usando o protocolo de partilha aberta.

Formatos colunares

Formatos binários de coluna otimizados para desempenho analítico de leitura e compressão.

Format Description
Parquet O formato colunar que o Apache Spark utiliza por defeito, com compressão e codificação eficientes.
ORC Um formato colunar com compressão incorporada e suporte para índices leves.

Formatos baseados em texto

Formatos legíveis por humanos para intercâmbio, configuração e registos com esquemas flexíveis ou em evolução.

Format Description
JSON Leia e escreva ficheiros JSON, incluindo opções para registos multilinha e inferência de esquemas.
CSV Leia e escreva ficheiros de texto delimitados, com opções para cabeçalhos, delimitadores e registos malformados.
XML Leia e escreva ficheiros XML especificando a etiqueta de linha e o esquema.
Texto Leia e escreva ficheiros de texto simples uma linha ou um ficheiro de cada vez.

Formatos binários e especializados

Formatos de serialização binária e fontes de dados específicas do Azure Databricks.

Format Description
Avro Leia e escreva ficheiros Avro e trabalhe com payloads codificados em Avro em streaming.
Experiência MLflow Carregue os dados de execução da experiência do MLflow utilizando a palavra-chave personalizada mlflow-experiment.

Dados não estruturados

Formatos e tipos para armazenar e processar documentos, imagens, áudio e outros ficheiros não estruturados.

Format Description
Trabalhar com dados não estruturados Armazenar, governar e processar dados não estruturados, como documentos, imagens e áudio.
Binário Leia ficheiros como registos binários brutos, incluindo imagens e outros dados não estruturados.
Image Carregar dados de imagem para cargas de trabalho de aprendizagem automática. A Databricks recomenda carregar imagens como dados binary.
ARQUIVO Armazene uma referência governada a um ficheiro não estruturado em vez de usar BINARY ou STRING.
Importar ficheiros como o tipo FILE Importe ficheiros não estruturados para tabelas como referências FILE utilizando SQL, funções com valor de tabela e Auto Loader.
Ficheiros de processo com UDFs Ler bytes de ficheiro, extrair metadados de imagens e vídeos e gerar ficheiros derivados com UDFs.
Guia de iniciação rápida das funções FILE Comece com o FILE tipo e as suas funções em Databricks SQL e Databricks Runtime.

Dados semiestruturados

Padrões e funções para trabalhar com dados aninhados e semi-estruturados na casa do lago.

Format Description
Modelos de dados semi-estruturados Escolha entre Variant, strings JSON, structs e mapas para armazenar dados semi-estruturados.
Variante Armazene dados semi-estruturados usando o VARIANT tipo para leituras e escritas otimizadas.
Transformar tipos de dados complexos Trabalhar com structs, arrays e mapas no Apache Spark.
Funções de ordem superior Transformar matrizes e mapas usando funções de ordem superior integradas.