Tarea de canalización para trabajos

Lakeflow Jobs proporciona un enfoque procedimental para definir relaciones entre tareas. Las canalizaciones de Lakeflow proporcionan un enfoque declarativo para definir relaciones entre conjuntos de datos y transformaciones. Programe una canalización para que se ejecute como una tarea de un trabajo mediante la interfaz de usuario de Trabajos, la interfaz de usuario de canalizaciones de Lakeflow o SQL.

Una tarea de canalización se ejecuta de una de estas dos formas, según la programación del trabajo:

  • En un trabajo activado o programado, la tarea de la canalización inicia una única actualización y se detiene cuando la actualización se completa.
  • En un trabajo en ejecución continua, la tarea de canalización ejecuta la canalización de forma continua. La programación del trabajo determina el modo de ejecución, por lo que la canalización se ejecuta de forma continua incluso si está activada su propia opción modo de canalización. Consulte Ejecutar una canalización de forma continua con un trabajo continuo.

Para más información sobre las canalizaciones desencadenadas y continuas, consulte Modo de canalizaciones continuas y desencadenadas.

Configurar una tarea de canalización con la interfaz de usuario de Jobs

Las canalizaciones de Lakeflow administran todas las configuraciones del código fuente y de los recursos de cómputo en la definición de la canalización.

Para agregar una canalización a un trabajo, complete los pasos siguientes:

  1. Cree y asigne un nombre a una nueva tarea y seleccione pipeline para el tipo.
  2. En el menú desplegable Canalización , seleccione una canalización existente.
  3. Opcionalmente, puede desencadenar una actualización completa en la canalización.
  4. Opcionalmente, puede establecer invalidaciones de parámetros en el campo Parámetros . Consulte Parámetros.
  5. (Opcional) Para configurar los reintentos o los umbrales del tiempo de ejecución y de acumulación de streaming, consulte Configuración avanzada de tareas.

Note

También puede crear una nueva canalización de ingesta al crear una tarea si elige el icono Más.Nueva canalización de ingesta desde el panel de tareas Agregar o la lista desplegable Tipo de tareas.

Para editar, clonar, deshabilitar o eliminar esta tarea, consulte Configuración y edición de tareas en trabajos de Lakeflow.

Alertas de acumulación de streaming y tareas de canalización

No se admiten los umbrales ni las notificaciones de la métrica de acumulación de streaming para las tareas de pipeline. Para monitorizar el backlog de streaming de una pipeline, utiliza uno de los siguientes en su lugar:

Ejecutar un pipeline de forma continua con un trabajo continuo

Cuando un trabajo continuo contiene una tarea de canalización, el trabajo ejecuta la canalización de forma continua. No necesitas configurar el modo de canalización integrado de la canalización en modo continuo: la programación de la tarea determina el modo de ejecución y tiene prioridad sobre la configuración del modo de canalización.

Esto solo se aplica a los oleoductos Lakeflow. Las vistas materializadas independientes y las tablas de streaming siempre funcionan en modo activado.

Un pipeline continuo incluido en un trabajo continuo puede usar modos de rendimiento sin servidor, como el modo Standard, que el modo continuo integrado del pipeline no admite.

Databricks recomienda ejecutar canalizaciones continuas con un trabajo continuo en lugar de la configuración continua integrada de la canalización. Para evitar comportamientos inesperados, configura el modo Pipeline de la tubería en activado (el predeterminado) cuando la envolves en un trabajo continuo. Para obtener más información, consulte Ejecutar una canalización continua con un trabajo continuo.

Puedes crear el trabajo continuo en la interfaz de empleos, directamente desde la página del pipeline o con Declarative Automation Bundles. Consulta Programar una tubería con la interfaz de la tubería y Definir un trabajo de tubería continua en Paquetes de Automatización Declarativa.

Define un trabajo de pipeline continuo en Paquetes de Automatización Declarativa

El siguiente ejemplo de Paquetes de Automatización Declarativa define un trabajo continuo que ejecuta una tubería como tarea. Configurar continuous.pause_status en UNPAUSED hace que la canalización se ejecute continuamente, y performance_target: STANDARD ejecuta el trabajo en modo de rendimiento estándar.

# resources/continuous_job.yml
resources:
  jobs:
    continuous_pipeline_job:
      name: continuous_pipeline_job
      performance_target: STANDARD
      continuous:
        pause_status: UNPAUSED
      email_notifications:
        on_failure:
          - your_email@example.com
      tasks:
        - task_key: refresh_pipeline
          pipeline_task:
            pipeline_id: ${resources.pipelines.example_pipeline.id}

Para migrar una tubería continua existente a un trabajo continuo, elimina el continuous campo de la definición de la canalización. La tarea configura a continuación la ejecución continua.

Para ver el payload equivalente de Jobs API, consulte la referencia jobs/create.

Canalización de sincronización de tablas de bases de datos

La tarea Database Table Sync pipeline es una tarea de pipeline que ejecuta el pipeline que mantiene una tabla sincronizada de Lakebase. Úselo para actualizar una tabla sincronizada según una programación o cuando cambie la tabla de catálogo de Unity de origen, de modo que las aplicaciones operativas lean los datos actuales de Lakebase Postgres.

En el menú desplegable Tipo de la tarea, pipeline de sincronización de tablas de base de datos aparece en Ingesta y transformación. Al seleccionarla, se configura una tarea de flujo de trabajo. En el campo Canalización , elija la canalización asociada a la tabla sincronizada que desea actualizar.

Para configurar la tarea de su tabla sincronizada, consulte la tarea de canalización de sincronización de tablas de base de datos.

Canalización de ingesta

La tarea Canalización de ingestión es una tarea de canalización que ejecuta una canalización de ingestión. En la lista desplegable Tipo de tarea, al elegir Canalización de ingesta se inicia el Asistente para agregar datos , que crea una tarea de canalización para una canalización de ingesta.

La primera página del asistente solicita el origen de datos. Las páginas siguientes dependen del origen que seleccione. Por ejemplo, si selecciona MySQL, consulte opción 1: Azure Databricks interfaz de usuario para conocer los pasos. Para las fuentes disponibles, véase conceptos de conectores Lakeflow Connect.

Parameters

Importante

Esta característica se encuentra en su versión beta. Los administradores del área de trabajo pueden controlar el acceso a esta característica desde la página Vistas previas . Consulte Administrar versiones preliminares de Azure Databricks.

Puede acceder a los parámetros de trabajo o de tarea en la tarea de canalización mediante referencias de valores dinámicos. Puede sobrescribir los parámetros añadiendo pares Clave-Valor en Parámetros de la configuración de su tarea.

Para obtener más información sobre cómo acceder a los valores de parámetro desde dentro de la canalización, consulte Acceso a los valores de parámetro desde una tarea.

Límites de concurrencia con tareas de canalización

Una canalización solo puede ejecutar una actualización cada vez. Los trabajos que contienen una tarea de canalización están sujetos a los siguientes límites de simultaneidad:

  • Un trabajo con max_concurrent_runs > 1 que contiene una tarea de canalización se limita a una sola ejecución simultánea. La interfaz de usuario del trabajo muestra un aviso cuando se aplica este límite.
  • Una tarea de canalización encapsulada en una tarea for-each está limitada a una sola iteración simultánea, independientemente de la simultaneidad configurada del bucle.

Tenga en cuenta estos límites al diseñar canalizaciones parametrizadas que tenga previsto ejecutar con muchas combinaciones de parámetros o en plazos ajustados.

Programar una canalización con la interfaz de usuario de canalización

Al agregar una programación a una canalización, se crea un trabajo con una sola tarea de canalización. Para obtener opciones más avanzadas de desencadenamiento, consulte Configurar una tarea de canalización con la interfaz de usuario de Jobs.

Configure una tarea de canalización en un trabajo programado mediante la interfaz de usuario de canalización completando los pasos siguientes:

  1. En el área de trabajo, haga clic en el icono Flujos de trabajo.Trabajos y canalizaciones en la barra lateral.
  2. Haga clic en el nombre de la canalización. Aparece la interfaz de usuario de canalización.
  3. Haga clic en Programar.
    • Si no existe ninguna programación para la canalización, aparecerá el cuadro de diálogo Nueva programación.
    • Si ya existe una o varias programaciones, haga clic en Agregar programación.
  4. En la lista desplegable de Tipo de disparador , selecciona un tipo de disparador:
  5. Escriba un nombre único para el trabajo en el campo nombre del trabajo.
  6. (Opcional) Para ejecutar la canalización en el modo de rendimiento estándar, desmarca la casilla Performance optimized. Consulte Seleccionar un modo de rendimiento.
  7. (Opcional) En Más opciones, configure una o varias direcciones de correo electrónico para recibir alertas sobre el inicio, el éxito o el error de la canalización.
  8. Haga clic en Crear.

Para un horario continuo, Azure Databricks inicia la ejecución automáticamente. Para detenerlo, haz clic en Detener en la página de la canalización o pausa la programación. Ambas acciones también cancelan la actualización activa.

Note

El botón Programar se actualiza para mostrar el número de programaciones existentes si la canalización se incluye en uno o varios trabajos programados; por ejemplo, Programación (5).

Agregar una programación a una vista materializada o una tabla de streaming en Databricks SQL

Las vistas materializadas y las tablas de streaming definidas en Databricks SQL admiten la programación basada en tiempo especificada en comandos CREATE o ALTER.

Para obtener detalles, vea los siguientes artículos:

Recursos adicionales