Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Las canalizaciones de Lakeflow se basan en Apache Spark™ Declarative Pipelines (SDP). Las canalizaciones de Lakeflow se ejecutan en el entorno de ejecución de Databricks optimizado para rendimiento e son interoperables con SDP. Dado que las canalizaciones se basan en SDP en lugar de las API propietarias, el código de transformación que escribe permanece portátil en otros entornos de ejecución de SDP.
¿Qué son las canalizaciones declarativas de Spark?
Apache Spark Declarative Pipelines es un marco declarativo para desarrollar y ejecutar canalizaciones de datos por lotes y streaming en SQL y Python. SDP automatiza la orquestación y organiza las dependencias entre los flujos de tu pipeline. SDP simplifica el desarrollo de ingesta y transformación, de modo que no tenga que centrarse en la mecánica de la orquestación de los flujos de trabajo de datos.
Entre los casos de uso comunes para SDP se incluyen:
- Ingesta de datos por lotes de orígenes como el almacenamiento en la nube (Amazon S3, Azure ADLS Gen2 y Google Cloud Storage).
- Ingesta de datos incrementales desde buses de mensajes (como Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub y Apache Pulsar).
- Transformaciones incrementales por lotes y de streaming con operadores sin estado y con estado.
Para más información sobre el procesamiento de datos declarativo, consulte Procesamiento de datos procedimental frente al declarativo en Databricks.
¿Cómo amplían los pipelines de Lakeflow el SDP?
Las canalizaciones de Lakeflow comparten el mismo modelo de creación declarativo que SDP y agregan características de producción como AUTO CDC, expectativas de calidad de datos y un registro de eventos consultable. En esta tabla se comparan las funcionalidades que las canalizaciones de Lakeflow comparten con SDP y las características de producción que Databricks agrega encima. Para obtener una correspondencia propiedad por propiedad entre la especificación del proyecto SDP y la configuración de pipeline, consulte Referencia de propiedades de pipeline.
| Capability | SDP | Canalizaciones de Lakeflow |
|---|---|---|
| Pipelines declarativos en SQL y Python | ✓ | ✓ |
| Tablas de streaming | ✓ | ✓ |
| Vistas materializadas | ✓ | ✓ |
| Vistas temporales | ✓ | ✓ |
| Agregar flujos | ✓ | ✓ |
| Destinos (Delta, Apache Kafka y Azure Event Hubs) | ✓ | ✓ |
| Orquestación automática y resolución de dependencias | ✓ | ✓ |
| Código de canalización que es portátil en entornos de ejecución de SDP | ✓ | ✓ |
| AUTO CDC (SCD tipo 1 y SCD tipo 2) y AUTO CDC a partir de una instantánea | — | ✓ |
| Expectativas de calidad de datos | — | ✓ |
| Registro de eventos consultable | — | ✓ |
Flujos de actualización y foreachBatchdestinos |
— | ✓ |
| Modo continuo | — | ✓ |