Tarefa de pipeline para trabalhos

O Lakeflow Jobs fornece uma abordagem procedural para definir relações entre tarefas. Os pipelines do Lakeflow oferecem uma abordagem declarativa para definir relações entre conjuntos de dados e transformações. Agenda um pipeline para ser executado como uma tarefa num trabalho, usando a interface Jobs, a interface de pipelines Lakeflow ou SQL.

Uma tarefa de pipeline executa o seu pipeline de duas formas, dependendo do cronograma do trabalho:

  • Numa tarefa acionada ou agendada, a tarefa de pipeline inicia uma atualização única e termina quando esta estiver concluída.
  • Num trabalho contínuo, a tarefa do pipeline executa o pipeline de forma contínua. O calendário do trabalho determina o modo de execução, pelo que o pipeline corre continuamente mesmo que a sua própria definição de modo Pipeline seja ativada. Veja : Executar um pipeline continuamente com um trabalho contínuo.

Para saber mais sobre pipelines acionados e contínuos, consulte Modo de pipeline acionado versus contínuo.

Configurar uma tarefa de pipeline com a Interface de Tarefas

Os pipelines do Lakeflow gerem todas as configurações do código-fonte e da computação na definição do pipeline.

Para adicionar um pipeline a um trabalho, conclua as seguintes etapas:

  1. Crie e nomeie uma nova tarefa e selecione pipeline para o Tipo.
  2. No menu suspenso de Pipeline, selecione um pipeline existente.
  3. Opcionalmente, você pode acionar uma atualização completa no pipeline.
  4. Podes opcionalmente definir overrides de parâmetros no campo Parâmetros . Consulte Parâmetros.
  5. (Opcional) Para configurar novas tentativas ou limiares de duração da execução e de acumulação do fluxo, consulte Definições avançadas da tarefa.

Note

Também pode criar um novo pipeline de ingestão ao criar uma tarefa escolhendo o ícone Plus.Novo pipeline de ingestão a partir do painel Adicionar tarefas ou do menu suspenso Tipo de tarefas.

Para editar, clonar, desativar ou eliminar esta tarefa, consulte Configurar e editar tarefas em Lakeflow Jobs.

Alertas de backlog em streaming e tarefas de pipeline

Os limiares e notificações de métricas de backlog de streaming não são suportados para tarefas de pipeline. Para monitorizar o backlog de streaming de um pipeline, use um dos seguintes dispositivos:

Executar um pipeline continuamente com um trabalho contínuo

Quando um trabalho contínuo contém uma tarefa de pipeline, o job executa o pipeline de forma contínua. Não precisa de definir o modo do Pipeline integrado do pipeline como contínuo: o agendamento da tarefa determina o modo de execução e tem prioridade sobre a definição do modo do Pipeline.

Isto aplica-se apenas aos oleodutos Lakeflow. As visualizações materializadas autónomas e as tabelas de streaming funcionam sempre em modo desencadeado.

Um pipeline contínuo encapsulado num trabalho contínuo pode usar modos de desempenho sem servidor, como o modo Standard, que o modo contínuo integrado do pipeline não suporta.

A Databricks recomenda executar pipelines contínuos com uma tarefa contínua, em vez da definição contínua incorporada no pipeline. Para evitar comportamentos inesperados, defina o modo Pipeline do pipeline para ativado (o padrão) quando o envolver num trabalho contínuo. Para mais informações, veja Executar um pipeline contínuo com um trabalho contínuo.

Pode criar o trabalho contínuo na interface de empregos, diretamente a partir da página do pipeline, ou com Pacotes de Automação Declarativa. Consulte Agendar um pipeline com a interface do pipeline e Definir um trabalho de pipeline contínuo em Pacotes de Automação Declarativa.

Defina um trabalho de pipeline contínuo em Pacotes de Automação Declarativa

O exemplo seguinte de Pacotes de Automação Declarativa define um trabalho contínuo que executa um pipeline como uma tarefa. Definir continuous.pause_status como UNPAUSED faz com que o pipeline seja executado continuamente, e performance_target: STANDARD executa a tarefa no modo de desempenho Padrão.

# resources/continuous_job.yml
resources:
  jobs:
    continuous_pipeline_job:
      name: continuous_pipeline_job
      performance_target: STANDARD
      continuous:
        pause_status: UNPAUSED
      email_notifications:
        on_failure:
          - your_email@example.com
      tasks:
        - task_key: refresh_pipeline
          pipeline_task:
            pipeline_id: ${resources.pipelines.example_pipeline.id}

Para migrar um pipeline contínuo existente para um trabalho contínuo, remova o campo continuous da definição do pipeline. A tarefa configura de seguida a execução contínua.

Para o conteúdo equivalente da API de Jobs, consulte a referência jobs/create.

Pipeline de Sincronização de Tabelas de Base de Dados

A tarefa pipeline Database Table Sync é uma tarefa pipeline que executa o pipeline mantendo uma tabela sincronizada com Lakebase. Utilize-o para atualizar uma tabela sincronizada de forma programada, ou quando a tabela de origem do Unity Catalog for alterada, para que as aplicações operacionais leiam dados atualizados do Lakebase Postgres.

Na lista pendente Tipo da tarefa, a canalização de sincronização de tabelas da base de dados aparece em Ingestão e Transformação. Ao selecioná-la, configura uma tarefa num pipeline. No campo Pipeline , escolhe o pipeline associado à tabela sincronizada que queres atualizar.

Para configurar a tarefa para a sua tabela sincronizada, consulte a tarefa de pipeline de sincronização de tabelas da base de dados.

Canal de ingestão

A tarefa canalização de ingestão é uma tarefa de canalização que executa uma canalização de ingestão. Na lista pendente Tipo da tarefa, escolher pipeline de ingestão inicia o assistente Adicionar dados, que cria uma tarefa de pipeline para um pipeline de ingestão.

A primeira página do mago pede a fonte de dados. As páginas seguintes dependem da fonte que selecionar. Por exemplo, se selecionar MySQL, veja a Opção 1: Azure Databricks UI para os passos. Para conhecer as fontes disponíveis, consulte os conceitos dos conectores Lakeflow Connect.

Parameters

Importante

Este recurso está em versão Beta. Os administradores do espaço de trabalho podem controlar o acesso a esse recurso na página Visualizações . Ver Gerir as pré-visualizações de Azure Databricks.

Pode aceder a parâmetros de trabalho ou tarefa na sua tarefa de pipeline usando referências dinâmicas de valor. Pode sobrescrever parâmetros adicionando pares Chave-Valor em Parâmetros da configuração da sua tarefa.

Para obter detalhes sobre como aceder aos valores dos parâmetros no seu pipeline, consulte Aceder aos valores dos parâmetros a partir de uma tarefa.

Limites de concorrência com tarefas de pipeline

Um pipeline só pode executar uma atualização de cada vez. Os trabalhos que contenham uma tarefa de pipeline estão sujeitos aos seguintes limites de concorrência:

  • Um trabalho com max_concurrent_runs > 1 que contém uma tarefa de pipeline está limitado a uma única execução concorrente. A interface de trabalho mostra um aviso quando este limite é aplicado.
  • Uma tarefa de pipeline envolvida numa tarefa for-each está limitada a uma iteração concorrente, independentemente da concorrência configurada do ciclo.

Tenha estes limites em conta ao conceber pipelines parametrizados que tenciona executar com muitas combinações de parâmetros ou com prazos apertados.

Agendar um pipeline através da interface de utilizador do pipeline

Adicionar um cronograma a um pipeline cria um trabalho com uma única tarefa da pipeline. Para opções de acionamento mais avançadas, consulte Configurar uma tarefa de pipeline com a IU de Trabalhos.

Configure uma tarefa de pipeline em um trabalho agendado usando a interface do usuário do pipeline concluindo as seguintes etapas:

  1. No espaço de trabalho, clique no ícone Fluxos de trabalho.Jobs & Pipelines na barra lateral.
  2. Clique no pipeline Name. A interface de utilizador do pipeline é exibida.
  3. Clique Agendar.
    • Se não existir nenhum agendamento para o pipeline, a caixa de diálogo Novo agendamento será exibida.
    • Se já existirem uma ou mais agendas, clique em Adicionar agenda.
  4. Na lista suspensa de tipos de gatilho , selecione um tipo de gatilho:
  5. Insira um nome exclusivo para o trabalho no campo Nome do trabalho.
  6. (Opcional) Para executar o pipeline no modo de desempenho Padrão, desmarque a caixa de verificação Otimizado para desempenho. Consulte Selecionar um modo de desempenho.
  7. (Opcional) Em Mais opções, configure um ou mais endereços de email para receber alertas sobre início, sucesso ou falha do pipeline.
  8. Clique em Criar.

Para um agendamento contínuo, o Azure Databricks inicia a execução automaticamente. Para o interromper, clique em Parar na página do pipeline ou coloque o agendamento em pausa. Ambas as ações também cancelam a atualização ativa.

Note

Se o pipeline estiver incluído em um ou mais trabalhos agendados, o botão Agenda mostrará o número de agendas existentes, por exemplo, Agenda (5).

Adicionar uma agenda a uma exibição materializada ou tabela de streaming no Databricks SQL

Exibições materializadas e tabelas de streaming definidas no Databricks SQL suportam agendamento baseado em tempo especificado em comandos CREATE ou ALTER.

Para obter detalhes, consulte os seguintes artigos:

Recursos adicionais