Desenvolver código de pipeline em seu ambiente de desenvolvimento local

Você pode desenvolver o código-fonte do pipeline em Python no seu ambiente de desenvolvimento integrado (IDE) preferido, executá-lo localmente para testes e, em seguida, validar, implantar e executar atualizações no seu espaço de trabalho do Azure Databricks sem sair do seu ambiente local.

Os pipelines do Lakeflow são um superconjunto dos pipelines declarativos do Apache Spark™. O código que usa apenas as APIs de Pipelines Declarativos do Apache Spark é executado localmente e em Azure Databricks, mas o código que usa recursos exclusivos para pipelines do Lakeflow, como AUTO CDC e expectativas, é executado apenas em Azure Databricks. Para conhecer as diferenças entre os recursos, consulte a referência da linguagem Python para pipelines do Lakeflow.

Para desenvolvimento interativo e testes no workspace do Azure Databricks, use o editor do Lakeflow Pipelines. Confira Desenvolver e depurar pipelines de ETL com o Editor do Lakeflow Pipelines.

Escrever código de pipeline com suporte ao IDE

Escreva o código do pipeline usando o pyspark.pipelines módulo, importado como dp:

from pyspark import pipelines as dp

Como o módulo faz parte do Apache Spark, o IDE fornece verificação de sintaxe, preenchimento automático e verificação de tipos enquanto você escreve. Normalmente, o código de Pipelines Declarativos do Apache Spark é executado sem modificação no Azure Databricks. Executar o mesmo comando de importação em um pipeline do Lakeflow importa a versão do Azure Databricks de pipelines. Para obter a referência completa de Python para pipelines do Lakeflow, consulte referência da linguagem Python para pipelines do Lakeflow.

Executar pipelines localmente para testes

Você também pode executar pipelines localmente para desenvolver e testar seu código antes de executá-lo no Azure Databricks. Use a interface de spark-pipelines linha de comando para inicializar, validar e executar um pipeline com o Apache Spark local. Consulte o Guia de Programação de Pipelines Declarativos do Spark na documentação do Apache Spark.

Não é possível executar ou testar a funcionalidade específica dos pipelines do Lakeflow localmente. Isso inclui expectativas e AUTO CDC funções.

Executar pipelines no Azure Databricks a partir do seu ambiente local

Use o databricks pipelines grupo de comandos para validar, implantar e executar atualizações de pipeline em seu workspace diretamente do terminal:

databricks pipelines init      # scaffold a pipeline project
databricks pipelines dry-run   # validate the pipeline graph without publishing data
databricks pipelines deploy    # deploy the project to your workspace
databricks pipelines run       # run an update

As atualizações do pipeline são executadas no seu workspace do Azure Databricks, e não no seu computador local, usando os recursos computacionais configurados para o pipeline. Esses comandos são interoperáveis com comandos de Pacotes bundle de Automação Declarativa, portanto, você pode começar com um projeto simples e adotar a configuração de pacote e as práticas de CI/CD à medida que ele cresce. Para instalar e configurar a CLI, consulte Instalar ou atualizar a CLI do Databricks. Para obter a referência de comando completa, consulte pipelines o grupo de comandos. Para um guia passo a passo, consulte Desenvolva pipelines com Pacotes de Automação Declarativa.

Sincronizar código de pipeline do seu IDE para um workspace

A tabela a seguir resume as opções para sincronizar o código-fonte do pipeline entre o IDE local e um workspace Azure Databricks:

Ferramenta ou padrão Detalhes
CLI do Databricks (grupo de comando pipelines) Use os databricks pipelines comandos para implantar e executar um projeto de pipeline em seu ambiente local. Consulte pipelines o grupo de comandos.
Pacotes de Automação Declarativa Use Pacotes de Automação Declarativa para implantar ativos de pipeline que variam em complexidade, desde um único arquivo de código-fonte até configurações para vários pipelines, trabalhos e arquivos de código-fonte. Consulte Converter um pipeline em um projeto de pacote.
Extensão do Databricks para Visual Studio Code Azure Databricks fornece uma integração com Visual Studio Code que inclui sincronização fácil entre o IDE local e os arquivos do workspace. Essa extensão também fornece ferramentas para usar Pacotes de Automação Declarativa para implantar ativos de pipelines. Consulte a extensão Databricks para Visual Studio Code.
Arquivos de espaço de trabalho Você pode usar arquivos da área de trabalho do Databricks para fazer upload do código-fonte do seu pipeline para o espaço de trabalho do Databricks e, em seguida, importar esse código para um pipeline. Veja o que são arquivos de workspace?.
Pastas do Git As pastas git permitem sincronizar o código entre seu ambiente local e Azure Databricks workspace usando um repositório Git como intermediário. Consulte Azure Databricks pastas Git.