Configurar um pipeline sem servidor

Os pipelines sem servidor são executados em recursos de computação geridos pelo Azure Databricks, eliminando a maior parte da configuração da infraestrutura.

A Databricks recomenda o desenvolvimento de novos pipelines usando tecnologia serverless (sem servidor). Algumas cargas de trabalho podem exigir a configuração da computação clássica ou o trabalho com o metastore herdado do Hive. Consulte Configurar processamento clássico para pipelines e Utilizar pipelines Lakeflow com o metastore legado do Hive.

Observação

  • Se precisar de usar uma ligação do Azure Private Link com os seus pipelines serverless do Lakeflow, contacte o seu representante da Databricks.

Requerimentos

  • Seu espaço de trabalho deve ter o Unity Catalog habilitado para usar pipelines sem servidor.

Importante

A permissão de criação de cluster não é necessária para configurar pipelines sem servidor. Por padrão, todos os usuários do espaço de trabalho podem usar pipelines sem servidor.

Pipelines serverless removem a maioria das opções de configuração, pois o Azure Databricks gere toda a infraestrutura. Quando você cria um novo pipeline, o padrão é usar serverless. Para saber como configurar um pipeline sem servidor, veja Configurar pipelines.

Você também pode converter pipelines existentes configurados com o Unity Catalog para usar sem servidor. Consulte Converter um pipeline existente para um sistema sem servidor.

Outras considerações de configuração

As seguintes opções de configuração também estão disponíveis para pipelines sem servidor:

  • Você pode optar por usar o modo Contínuo de pipeline ao executar pipelines em produção. Consulte Modo de fluxo de trabalho acionado versus contínuo.
  • Adicione Notificações para atualizações por e-mail com base em condições de sucesso ou falha. Ver Adicionar notificações por e-mail para eventos de pipeline.
  • Utilize o campo de Configuração para definir pares chave-valor para o pipeline. Estas configurações servem duas finalidades:
  • Use o canal Pré-visualização para testar o seu pipeline contra alterações pendentes em tempo de execução e experimentar novas funcionalidades.
  • Declare dependências externas de Python nas definições de Ambiente do pipeline. Reiniciar manualmente o processo Python (dbutils.library.restartPython()) não é suportado, por isso não pode instalar ou recarregar dependências em tempo de execução. Consulte Gerenciar dependências Python para pipelines.

Política de utilização serverless

Importante

Este recurso está no Public Preview.

As políticas de utilização serverless permitem que a sua organização aplique tags personalizadas ao uso serverless para atribuição granular de faturação. Depois de selecionar a caixa de verificação Serverless, aparece a definição Política de utilização, na qual pode selecionar a política que pretende aplicar ao pipeline. As etiquetas são herdadas da política serverless de utilização e só podem ser editadas pelos administradores do espaço de trabalho.

Observação

Depois de lhe ser atribuída uma política de uso serverless, os seus pipelines existentes não são automaticamente associados à sua política. Você deve atualizar manualmente os fluxos de trabalho existentes se quiser anexar uma política a eles.

Para mais informações sobre políticas de utilização serverless, veja Utilização de atributos com políticas de utilização serverless.

Selecione um modo de desempenho

Para pipelines acionados, você pode selecionar o modo de desempenho de computação sem servidor usando a configuração Desempenho otimizado no agendador de pipeline. Quando essa configuração é desabilitada, o pipeline usa o modo de desempenho padrão. O modo de desempenho padrão foi projetado para reduzir os custos de cargas de trabalho em que uma latência de inicialização um pouco maior é aceitável. As cargas de trabalho sem servidor que usam o modo de desempenho padrão normalmente começam dentro de quatro a seis minutos após serem acionadas, dependendo da disponibilidade de computação e do agendamento otimizado.

Quando o desempenho otimizado está habilitado, seu pipeline é otimizado para desempenho, resultando em inicialização e execução mais rápidas para cargas de trabalho sensíveis ao tempo.

Ambos os modos usam a mesma SKU, mas o modo de desempenho padrão consome menos DBUs, refletindo menor uso de computação.

Observação

Para usar o modo de desempenho padrão em pipelines contínuos, entre em contato com sua equipe de conta do Databricks.

Funcionalidades de uma pipeline sem servidor

Além de simplificar a configuração, os pipelines sem servidor têm os seguintes recursos:

  • Atualização incremental para modos de exibição materializados: As atualizações para modos de exibição materializados são atualizadas incrementalmente sempre que possível. A atualização incremental tem os mesmos resultados que a recomputação completa. A atualização usa uma atualização completa se os resultados não puderem ser calculados incrementalmente. Consulte Atualização incremental para ver vistas materializadas.
  • Stream pipelining: Para melhorar a utilização, a taxa de transferência e a latência para cargas de trabalho de streaming de dados, como ingestão de dados, os microlotes são canalizados. Por outras palavras, em vez de executar microlotes sequencialmente como o Spark Structured Streaming padrão, os pipelines Lakeflow serverless executam microlotes em simultâneo, melhorando a utilização dos recursos computacionais. O encadeamento de fluxo é ativado por padrão em pipelines serverless.
  • Escalamento automático vertical: os pipelines Lakeflow sem servidor acrescentam-se ao escalamento automático horizontal proporcionado pelo escalamento automático otimizado do Databricks, alocando automaticamente os tipos de instância com melhor relação custo-benefício capazes de executar o seu pipeline sem falhar devido a erros de memória insuficiente. Consulte O que é o dimensionamento automático vertical?

Converter um pipeline existente para usar sem servidor

Você pode converter pipelines existentes configurados com o Unity Catalog em pipelines sem servidor. Conclua as seguintes etapas:

  1. Na barra lateral do seu workspace do Azure Databricks, clique em Jobs & Pipelines.
  2. Clique no Nome da pipeline.
  3. Clique em Configurações.
  4. Na barra lateral direita, em Computação, clique no ícone Lápis..
  5. Marque a caixa ao lado de (sem servidor).
  6. Clique em Salvar.

Importante

Quando você habilita o serverless, todas as configurações de computação definidas para um pipeline são removidas. Se alterares um pipeline de volta para atualizações não sem servidor, deverás reconfigurar as configurações de computação desejadas na configuração do mesmo.

Localize a utilização de DBU de um pipeline serverless

Pode encontrar a utilização de DBU dos pipelines Lakeflow sem servidor ao consultar a tabela de utilização faturável, que faz parte das tabelas de sistema do Azure Databricks. Consulte Qual é o consumo de DBU de um pipeline sem servidor?.