Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Observação
Os conectores Lakeflow Connect estão em vários estados de lançamento.
O Lakeflow Connect organiza conectores por tipo de fonte, incluindo conectores de banco de dados, SaaS, arquivos e streaming, além de conectores comunitários e personalizados para fontes sem opção embutida. Esta página descreve os conceitos compartilhados pelos conectores gerenciados do Lakeflow Connect: os tipos de conectores disponíveis, como um conector é estruturado, como ele funciona e como ele ingere dados de forma incremental. Conectores gerenciados produzem pipelines de ingestão que são governados pelo Unity Catalog e alimentados por pipelines serverless compute e Lakeflow, usando leituras e gravações incrementais eficientes para manter seus dados frescos para consumo posterior.
Se você precisar de mais controle sobre seus pipelines, também poderá usar conectores padrão, abrindo mão de parte da automação em troca de suporte a mais fontes e de maior personalização. Veja Escolha um conector padrão.
Tipos de conector
| Tipo de conector | Descrição |
|---|---|
| Conectores da comunidade | Ingerir dados usando conectores de software livre e criados pela comunidade. |
| Conectores de banco de dados (CDC) | Ingerir dados de bancos de dados relacionais, incluindo MySQL, PostgreSQL e SQL Server usando a captura de dados de alteração. |
| Conectores de origem do arquivo | Ingerir arquivos não estruturados e estruturados de serviços de armazenamento de arquivos corporativos, incluindo Google Drive e SharePoint. |
| Conectores baseados em consulta | Importe dados dos bancos de dados consultando diretamente a origem, sem exigir a configuração do CDC (captura de dados de alterações). |
| Conectores SaaS | Ingira dados de aplicativos SaaS empresariais, incluindo Salesforce, HubSpot, Jira, Workday e muito mais. |
| Conectores de streaming | Ingira continuamente dados de barramentos de mensagens e fontes de streaming de eventos, incluindo RabbitMQ. |
Arquitetura
Cada tipo de conector tem um conjunto distinto de componentes. SaaS e conectores de arquivos usam uma conexão, um pipeline de ingestão e tabelas de destino. Os conectores de banco de dados também incluem um gateway de ingestão e armazenamento intermediário para dar suporte à captura de alterações contínuas. Conectores baseados em consulta e streaming utilizam os componentes descritos nas seções a seguir. Para detalhes sobre conectores SaaS e banco de dados, veja conectores SaaS gerenciados e conectores de banco de dados gerenciados.
Componentes de conectores baseados em consultas
Um conector baseado em consultas consulta diretamente o banco de dados de origem de forma programada, sem um gateway ou armazenamento de preparo. Para obter uma visão geral de como funcionam os conectores baseados em consulta, consulte conectores baseados em consulta.
| Componente | Descrição |
|---|---|
| Conexão | Um objeto de segurança do Unity Catalog que armazena detalhes de autenticação para o banco de dados de origem. Uma conexão direta com o Unity Catalog (para a ingestão de conexões estrangeiras) ou um catálogo estrangeiro do Unity Catalog (para a ingestão de catálogos estrangeiros usando a Federação do Lakehouse). |
| Canal de ingestão | Um pipeline que consulta diretamente o banco de dados de origem e grava os resultados em tabelas de streaming. O pipeline é executado na computação sem servidor por padrão. |
| Tabelas de destino | As tabelas de streaming nas quais o pipeline de ingestão grava os dados. |
Componentes do conector de streaming
Um conector de streaming lê continuamente mensagens de um barramento de mensagens ou de uma fonte de streaming de eventos e as grava em tabelas de streaming. Para uma visão geral de como funcionam os conectores de streaming, veja Conectores de streaming.
| Componente | Descrição |
|---|---|
| Conexão | Um objeto securizável do Unity Catalog que armazena o endpoint de origem e as credenciais de autenticação da sua origem de streaming. O conector gerenciado usa essa conexão para se autenticar sem exigir credenciais na configuração do pipeline. |
| Canal de ingestão | Um pipeline que lê continuamente mensagens da fonte de streaming e grava os resultados em tabelas de streaming. A execução de pipeline acontece em computação sem servidor. |
| Tabelas de destino | As tabelas de streaming nas quais o pipeline de ingestão grava os dados. |
Orquestração
Você pode executar o seu pipeline de ingestão em uma ou mais agendas personalizadas. Para cada cronograma que você adiciona a um pipeline, o Lakeflow Connect cria automaticamente um job para ele. O pipeline de ingestão é uma tarefa que está dentro do trabalho. Opcionalmente, você pode adicionar mais tarefas ao trabalho.
Para os conectores de banco de dados, o gateway de ingestão opera em seu próprio processo como uma tarefa contínua.
Ingestão incremental
O Lakeflow Connect usa a ingestão incremental para aumentar a eficiência do pipeline. Na primeira execução do pipeline, ele ingere todos os dados selecionados da origem. Em paralelo, ele rastreia as alterações nos dados de origem. Em cada execução subsequente do pipeline, quando possível, ele usa esse rastreamento de alterações para processar somente os dados que foram alterados em relação à execução anterior.
A abordagem exata depende do que está disponível em sua fonte de dados. Por exemplo, você pode usar o controle de alterações e a CDC (captura de dados de alteração) com SQL Server. Por outro lado, o conector Salesforce seleciona uma coluna de cursor de uma lista de opções pré-definida.
Algumas fontes ou tabelas específicas não dão suporte à ingestão incremental no momento. O Databricks planeja expandir a cobertura para suporte incremental.
Rede
Há várias opções para se conectar a um aplicativo ou banco de dados SaaS.
- Conectores para aplicativos SaaS acessam as APIs da origem. Eles também são automaticamente compatíveis com controles de saída sem servidor.
- Conectores para bancos de dados em nuvem podem se conectar à fonte usando o Link Privado. Alternativamente, se o workspace tiver uma VNet (rede virtual) ou VPC (nuvem virtual privada) emparelhada com a VNet ou a VPC que hospeda seu banco de dados, você poderá implantar o gateway nela.
- Conectores para bancos de dados locais podem se conectar usando serviços como o AWS Direct Connect e Azure ExpressRoute.
Implantação
Você pode implantar os pipelines de ingestão usando Pacotes de Automação Declarativa, que permitem práticas recomendadas como controle de origem, revisão de código, testes e integração e entrega contínuas (CI/CD). Os pacotes são gerenciados usando a CLI do Databricks e podem ser executados em diferentes workspaces de destino, como desenvolvimento, preparo e produção.
Criar conexões programaticamente
Para conectores que usam autenticação somente via API (todos os conectores de bancos de dados e a maioria dos conectores de SaaS), você pode criar conexões de forma programática usando notebooks, a CLI do Databricks ou Pacotes de Automação Declarativa, em vez da interface do usuário do Explorador de Catálogos.
- Notebooks: use a API de Conexões em um notebook para criar uma conexão e passá-la ao pipeline.
-
CLI do Databricks: execute
databricks connections createcom--jsonpara passar o tipo de conexão e as credenciais. O corpo JSON segue o mesmo esquema que a API REST de Conexões. -
Pacotes de Automação Declarativa: use um script de pré-implantação ou tarefa de trabalho para chamar
databricks connections createcomo parte do fluxo de trabalho do pacote antes de implantar o pipeline.
Observação
Conectores que usam OAuth (OAuth U2M) baseado em navegador como sua única opção de autenticação não podem ser criados programaticamente. Esses conectores exigem uma entrada interativa para obter o token OAuth inicial. Isso inclui: Confluence, Google Ads, HubSpot, Jira, Meta Ads, Slack, Slack Audit Logs, TikTok Ads e Zendesk Support.
Recuperação de falha
Como um serviço totalmente gerenciado, o Lakeflow Connect pretende se recuperar automaticamente de problemas quando possível. Por exemplo, ao falhar, o conectar tenta novamente automaticamente com a retirada exponencial.
No entanto, é possível que um erro exija sua intervenção (por exemplo, quando as credenciais expiram). Nesses casos, o conector tenta evitar a falta de dados armazenando a última posição do cursor. Depois, o sistema pode retomar a partir dessa posição na próxima execução do pipeline, quando possível.
Monitorização
O Lakeflow Connect fornece alertas e monitoramento robustos para ajudá-lo a manter seus pipelines. Isso inclui registros de eventos, registros de cluster, métricas de integridade do pipeline e métricas de qualidade de dados. Você também pode usar a system.billing.usage tabela para acompanhar os custos e monitorar o uso do pipeline. Consulte Monitorar custo do pipeline de ingestão gerenciada.
Para conectores de banco de dados, você pode monitorar o progresso do gateway em tempo real usando logs de eventos. Consulte Monitorar o progresso do gateway de ingestão usando logs de eventos.
Conectores da comunidade
Os conectores da comunidade estendem o Lakeflow Connect a fontes sem suporte para conectores gerenciados. Eles são construídos e mantidos pela comunidade. Consulte os Conectores da Comunidade no Lakeflow Connect.
Conectores personalizados
Se nenhum conector gerenciado ou comunitário suporta sua fonte, você pode construir seu próprio conector personalizado e rodá-lo no seu espaço de trabalho. Veja Construir um conector personalizado para o Lakeflow Connect.
Dependência de serviços externos
O Databricks SaaS, o banco de dados e outros conectores totalmente gerenciados dependem da acessibilidade, da compatibilidade e da estabilidade do aplicativo, do banco de dados ou do serviço externo ao qual se conectam. O Databricks não controla esses serviços externos e, portanto, tem influência limitada (se houver) sobre suas alterações, atualizações e manutenção.
Se alterações, interrupções ou circunstâncias relacionadas a um serviço externo impedirem ou renderizarem impraticáveis a operação de um conector, o Databricks poderá descontinuar ou deixar de manter esse conector. O Databricks fará esforços razoáveis para notificar os clientes sobre a descontinuação ou cessação da manutenção, incluindo atualizações na documentação aplicável.