Desenvolva código de pipeline em seu ambiente de desenvolvimento local

Pode criar código-fonte de pipeline Python no seu ambiente integrado de desenvolvimento (IDE) preferido, executá-lo localmente para testes, depois validar, implementar e executar atualizações no seu espaço de trabalho Azure Databricks sem sair do ambiente local.

Os oleodutos Lakeflow são um superconjunto dos Oleodutos Declarativos Apache Spark™. O código que utiliza apenas as APIs Declarative Pipelines do Apache Spark é executado tanto localmente como no Azure Databricks, mas o código que utiliza funcionalidades exclusivas dos pipelines do Lakeflow, como AUTO CDC e expectativas, é executado apenas no Azure Databricks. Para as diferenças de funcionalidades, consulte a referência da linguagem Python dos pipelines Lakeflow.

Para desenvolvimento e testes interativos no espaço de trabalho do Azure Databricks, utilize o Lakeflow Pipelines Editor. Consulte Desenvolver e depurar pipelines ETL com o Lakeflow Pipelines Editor.

Escreva código de pipeline com suporte do IDE

Escrever código de pipeline utilizando o módulo pyspark.pipelines, importado como dp:

from pyspark import pipelines as dp

Como o módulo faz parte do Apache Spark, o seu IDE fornece verificação de sintaxe, conclusão automática e verificação de tipos à medida que escreve. O código Apache Spark Declarative Pipelines normalmente corre sem modificações no Azure Databricks. Executar o mesmo comando de importação num pipeline do Lakeflow importa a versão do pipelines do Azure Databricks. Para obter a referência completa da linguagem Python para os pipelines Lakeflow, consulte a referência da linguagem Python para os pipelines Lakeflow.

Executar pipelines localmente para testes

Também podes executar pipelines localmente para desenvolver e testar o teu código antes de o executares no Azure Databricks. Use a spark-pipelines interface de linha de comandos para inicializar, validar e executar um pipeline com o Apache Spark local. Consulte o Guia de Programação de Pipelines Declarativos do Spark na documentação do Apache Spark.

Não pode executar ou testar funcionalidades específicas dos pipelines Lakeflow localmente. Isto inclui expectativas e AUTO CDC funções.

Execute pipelines no Azure Databricks a partir do seu ambiente local

Use o databricks pipelines grupo de comandos para validar, implementar e executar atualizações do pipeline no seu espaço de trabalho, diretamente a partir do seu terminal:

databricks pipelines init      # scaffold a pipeline project
databricks pipelines dry-run   # validate the pipeline graph without publishing data
databricks pipelines deploy    # deploy the project to your workspace
databricks pipelines run       # run an update

As atualizações do pipeline são executadas no seu espaço de trabalho Azure Databricks, não na sua máquina local, usando o cálculo configurado para o pipeline. Estes comandos são interoperáveis com comandos do Declarative Automation Bundles bundle , pelo que pode começar com um projeto simples e adotar práticas de configuração de bundles e CI/CD à medida que cresce. Para instalar e configurar a CLI, consulte Instalar ou atualizar a CLI Databricks. Para a referência completa de comandos, veja pipelines grupo de comandos. Para uma explicação passo a passo, consulte Desenvolvimento de pipelines com Pacotes de Automação Declarativa.

Sincronizar código de pipeline do seu IDE para um espaço de trabalho

A tabela seguinte resume as opções para sincronizar o código-fonte do pipeline entre o seu IDE local e um espaço de trabalho do Azure Databricks:

Ferramenta ou padrão Detalhes
Databricks CLI (pipelines grupo de comandos) Usa os databricks pipelines comandos para implementar e executar um projeto de pipeline a partir do teu ambiente local. Consulte pipelines o grupo de comandos.
Pacotes de Automação Declarativa Use Pacotes de Automação Declarativa para implementar ativos de pipeline que variam em complexidade desde um único ficheiro de código-fonte até configurações para múltiplos pipelines, jobs e ficheiros de código-fonte. Veja Converter um pipeline num projeto de pacote.
Extensão Databricks para Visual Studio Code O Azure Databricks oferece uma integração com o Visual Studio Code que inclui uma sincronização fácil entre o seu IDE local e os ficheiros do espaço de trabalho. Esta extensão também fornece ferramentas para usar os Declarative Automation Bundles na implementação dos recursos de pipelines. Consulte a extensão Databricks para Visual Studio Code.
Arquivos de espaço de trabalho Você pode usar os arquivos do espaço de trabalho Databricks para carregar o código-fonte do pipeline para o espaço de trabalho do Databricks e, em seguida, importar esse código para um pipeline. Consulte O que são arquivos de espaço de trabalho?.
Diretórios Git As pastas Git permitem-te sincronizar código entre o teu ambiente local e o espaço de trabalho do Azure Databricks usando um repositório Git como intermediário. Veja Azure Databricks repositórios Git.