Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Orquestrar tarefas com o Lakeflow Jobs para ler e processar um conjunto de dados de exemplo. Neste início rápido, você:
- Crie um novo caderno e adicione código para ler um conjunto de dados de exemplo de reservas de propriedades.
- Salve o conjunto de dados no Unity Catalog.
- Crie um novo notebook e adicione código para ler o conjunto de dados do Catálogo do Unity, filtrá-lo por ano e exibir os resultados.
- Crie um novo trabalho e configure duas tarefas usando os notebooks.
- Execute o trabalho e veja os resultados.
Requisitos
Se seu espaço de trabalho tiver o Catálogo do Unity habilitado e os Trabalhos Sem Servidor estiverem habilitados, o trabalho será executado em computação sem servidor por padrão. Você não precisa de permissão de criação de cluster para executar seu trabalho com computação sem servidor.
Caso contrário, você deverá ter permissão de criação de cluster para criar computação de trabalho ou permissões para recursos de computação para todos os fins.
Esse guia de início rápido lê de samples.wanderbricks.bookings, que está disponível em todos os espaços de trabalho com o Unity Catalog habilitado, portanto não há dados de origem para configurar. Para gravar a tabela que o segundo notebook lê, você precisa de permissão para criar um esquema em um catálogo (os privilégios USE CATALOG e CREATE SCHEMA).
Para definir essas permissões, consulte o administrador do Databricks ou a referência de privilégios do Catálogo Unity.
Criar blocos de anotações
As etapas a seguir criam dois notebooks para serem executados neste fluxo de trabalho.
Recuperar e salvar dados
Para criar um caderno que leia o conjunto de dados de exemplo e o salve no Unity Catalog:
Clique em
Novo na barra lateral e clique em Bloco de Anotações.
O Databricks cria e abre um novo notebook em branco em sua pasta padrão. O idioma padrão é o idioma usado mais recentemente e o notebook é anexado automaticamente ao recurso de computação que você usou mais recentemente.(Opcional) Renomeie o notebook Recuperar dados da reserva.
Se necessário, altere o idioma padrão para Python.
Copie o código Python a seguir e cole-o na primeira célula do notebook. Antes de executá-lo, verifique se
catalogeschemaapontam para um local em que você possa gravar. O código cria o esquema caso ele não exista.catalog = "main" schema = "example_output" spark.sql(f"CREATE SCHEMA IF NOT EXISTS {catalog}.{schema}") bookings = spark.read.table("samples.wanderbricks.bookings") bookings.write.mode("overwrite").saveAsTable(f"{catalog}.{schema}.bookings")
Ler e exibir os dados filtrados
Para criar um bloco de anotações que filtra e exibe seus dados:
Clique em
Novo na barra lateral e clique em Bloco de Anotações.(Opcional) Renomeie o notebook para Filtrar dados de reservas.
O código Python a seguir lê a tabela que você salvou na etapa anterior e cria uma visualização temporária. Também cria um widget que você pode usar para filtrar os dados na visualização por ano de check-in. Use os mesmos valores de
catalogeschemaque você usou no primeiro notebook.from pyspark.sql.functions import year catalog = "main" schema = "example_output" bookings = spark.read.table(f"{catalog}.{schema}.bookings") bookings.createOrReplaceTempView("bookings_table") years = spark.sql("SELECT DISTINCT year(check_in) AS year FROM bookings_table").toPandas()["year"].tolist() years.sort() dbutils.widgets.dropdown("year", "2025", [str(x) for x in years]) display(bookings.filter(year(bookings.check_in) == dbutils.widgets.get("year")))
Criar um trabalho
O trabalho que você está criando consiste em duas tarefas.
Para criar a primeira tarefa:
- No seu espaço de trabalho, clique no
Tarefas e Pipelines na barra lateral.
- Clique em Criar e depois em Job.
- Clique no bloco do Notebook para configurar a primeira tarefa. Se a guia Notebook não estiver disponível, clique em Adicionar outro tipo de tarefa e pesquise por Notebook.
- (Opcional) Substitua o nome da tarefa, cujo padrão é
New Job <date-time>, pelo nome da sua tarefa. - No campo Nome da tarefa , insira um nome para a tarefa; Por exemplo, recuperação-reservas.
- Se necessário, selecione Notebook no menu suspenso Tipo.
- No menu suspenso Origem, selecione Workspace, o que permite usar um notebook salvo anteriormente.
- Para Caminho, use o explorador de arquivos para localizar o primeiro notebook que você criou, clique no nome do notebook e clique em Confirmar.
- Clique em Salvar tarefa. Uma notificação é exibida no canto superior direito da tela.
Para criar a segunda tarefa:
- Clique
Adicionar tarefa>Bloco de anotações.
- No campo Nome da tarefa , insira um nome para a tarefa; Por exemplo, filtros-reservas.
- Em Caminho, use o navegador de arquivos para localizar o segundo notebook que você criou, clique no nome do notebook e clique em Confirmar.
- Clique em Adicionar em Parâmetros. No campo Chave, insira
year. No campo Valor, insira2025. - Clique em Salvar tarefa.
Executar a tarefa
Para executar o trabalho imediatamente, clique no
no canto superior direito.
Exibir detalhes de execução
Clique na guia Execuções e clique no link na coluna Hora de Início para abrir a execução que você deseja exibir.
Clique em qualquer uma das tarefas para ver a saída e os detalhes. Por exemplo, clique na tarefa filter-bookings para visualizar a saída e os detalhes da execução da tarefa de filtro:
Execução com parâmetros diferentes
Para executar novamente a tarefa e filtrar as reservas de um ano diferente:
- Clique em
ao lado de Executar agora e selecione Executar agora com configurações diferentes. - No campo Valor, insira
2024. - Clique em Executar.
Recursos adicionais
- Defina configurações de trabalho, como agendamentos, notificações e parâmetros. Consulte Configurar e editar Trabalhos do Lakeflow.
- Explore os tipos de tarefa disponíveis. Consulte tipos de tarefas.
- Execute trabalhos automaticamente em um agendamento ou quando novos dados chegarem. Consulte Automatizar trabalhos com agendas e gatilhos.
- Monitore execuções de tarefas e configure alertas. Consulte Monitor Lakeflow Jobs.