Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
:::note Cumplimiento
El conector de SharePoint administrado admite el uso en áreas de trabajo con la opción Configurar la seguridad mejorada y la configuración de cumplimiento habilitada.
:::
En esta página se muestra cómo crear una canalización de ingesta administrada de Microsoft SharePoint mediante Lakeflow Connect.
Antes de empezar
Para crear la canalización de ingesta, primero debe cumplir los siguientes requisitos:
Su área de trabajo debe estar habilitada para Unity Catalog.
La computación sin servidor debe estar habilitada para tu espacio de trabajo. Consulte Requisitos de proceso sin servidor.
Para crear una nueva conexión, debe tener privilegios de
CREATE CONNECTIONen el metastore. Consulte Administración de privilegios en Unity Catalog.Si el conector admite la creación de canalizaciones basadas en la interfaz de usuario, un administrador puede crear la conexión y la canalización al mismo tiempo completando los pasos de esta página. Sin embargo, si los usuarios que crean canalizaciones usan la creación de canalizaciones basadas en API o son usuarios que no son administradores, un administrador debe crear primero la conexión en el Explorador de catálogos. Consulte Conexión a orígenes de ingesta administrados.
Para usar una conexión existente, debe tener
USE CONNECTIONprivilegios oALL PRIVILEGESen el objeto de conexión.Debe tener
USE CATALOGprivilegios en el catálogo de destino.Debe tener privilegios
USE SCHEMAyCREATE TABLEen un esquema existente o privilegiosCREATE SCHEMAen el catálogo de destino.
Para ingerir desde SharePoint, primero debe configurar un método de autenticación compatible. Consulte Configurar OAuth U2M: administrado por Databricks (Recomendado).
Creación de una canalización de ingesta
Para obtener una lista de los formatos de archivo admitidos y las limitaciones específicas del conector, consulte Microsoft SharePoint limitaciones del conector.
Interfaz de usuario de Databricks
- En la barra lateral del área de trabajo de Azure Databricks, haga clic en Ingesta de datos.
- En la página Agregar datos, en la sección Conectores de Databricks, haga clic en Microsoft SharePoint.
- En el paso Conexión del Asistente para ingesta, seleccione la conexión que almacena las credenciales de acceso SharePoint. Si tiene el privilegio
CREATE CONNECTIONsobre el metastore, puede hacer clic enCrear conexión para crear una nueva conexión con los datos de autenticación que se indican en Información general sobre la configuración de la ingesta de SharePoint.
- Haga clic en Siguiente.
- En el paso Configuración de ingesta, introduzca un nombre para la canalización.
- Seleccione un catálogo y un esquema para la canalización. Si tiene los privilegios
USE CATALOGyCREATE SCHEMAsobre el catálogo, puede hacer clic enCrear esquema en el menú desplegable para crear un nuevo esquema.
- Haga clic en Crear canalización de ingesta e inicie el proceso.
- En el paso Origen, configure las opciones de ingesta de archivos y dirección URL de SharePoint.
- Haga clic en Guardar y continuar.
- En el paso Destino , seleccione un catálogo y un esquema en el que cargar datos. Si tiene los privilegios
USE CATALOGyCREATE SCHEMAsobre el catálogo, puede hacer clic enCrear esquema en el menú desplegable para crear un nuevo esquema.
- Haga clic en Guardar y continuar.
- (Opcional) En el paso Programaciones y notificaciones , haga clic en
Crear programación. Establezca la frecuencia para actualizar las tablas de destino.
- (Opcional) Haga clic en
Agregue una notificación para establecer notificaciones por correo electrónico para que la operación de canalización se complete correctamente o no y, a continuación, haga clic en Guardar y ejecutar canalización.
Notebook de Databricks
Importe el cuaderno siguiente en el área de trabajo de Azure Databricks:
No modifique la celda 1.
Modifique la celda tres con los detalles de configuración de la canalización. Consulte pipeline.ingestion_definition y ejemplos.
Haga clic en Ejecutar todo.
Agrupaciones de automatización declarativa
Use agrupaciones de automatización declarativa para administrar canalizaciones de SharePoint como código. Las agrupaciones pueden contener definiciones de YAML de trabajos y tareas, se administran mediante la CLI de Databricks y se pueden compartir y ejecutar en diferentes áreas de trabajo de destino (como desarrollo, almacenamiento provisional y producción). Para obtener más información, consulte ¿Qué son los conjuntos de automatización declarativos?.
Cree una agrupación mediante la CLI de Databricks:
databricks bundle initAgregue dos nuevos archivos de recursos al lote:
- Un archivo de definición de canalización (por ejemplo,
resources/sharepoint_pipeline.yml). Consulte pipeline.ingestion_definition y ejemplos. - Un archivo de definición de trabajo que controla la frecuencia de ingesta de datos (por ejemplo,
resources/sharepoint_job.yml).
- Un archivo de definición de canalización (por ejemplo,
Implemente la canalización mediante la CLI de Databricks:
databricks bundle deploy
Examples
Use estos ejemplos para configurar la canalización.
Ingesta de archivos como datos no estructurados
Ingerir todos los archivos de un sitio de SharePoint como contenido binario. Use este enfoque para archivos PDF, documentos de Office y otros archivos que pretende procesar de bajada, por ejemplo, para aplicaciones RAG.
Nota:
Disponible en Beta, el FILE tipo almacena una referencia gobernada a cada archivo y sus metadatos en lugar de los bytes del archivo, lo que mejora el rendimiento de lectura. Para ingerir archivos como tipo FILE en lugar de BINARYFILE, véase los archivos Ingest como el tipo ARCHIVO (Beta).
Agrupaciones de automatización declarativa
resources:
pipelines:
sharepoint_binary_pipeline:
name: sharepoint_binary_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <sharepoint-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: site_files
connector_options:
sharepoint_options:
entity_type: FILE
url: https://<tenant>.sharepoint.com/sites/<site>
file_ingestion_options:
format: BINARYFILE
schema_evolution_mode: NONE
Notebook de Databricks
pipeline_spec = """
{
"name": "<pipeline-name>",
"catalog": "main",
"schema": "ingest_destination_schema",
"ingestion_definition": {
"connection_name": "<sharepoint-connection>",
"objects": [
{
"table": {
"destination_catalog": "main",
"destination_schema": "ingest_destination_schema",
"destination_table": "site_files",
"connector_options": {
"sharepoint_options": {
"entity_type": "FILE",
"url": "https://<tenant>.sharepoint.com/sites/<site>",
"file_ingestion_options": {
"format": "BINARYFILE",
"schema_evolution_mode": "NONE"
}
}
}
}
}
]
},
"channel": "PREVIEW"
}
"""
create_pipeline(pipeline_spec)
Ingesta archivos como tipo de archivo (Beta)
Importante
Esta característica se encuentra en su versión beta. Los administradores del área de trabajo pueden controlar el acceso a esta característica desde la página Vistas previas . Consulte Administración de versiones preliminares de Azure Databricks.
Ingesta archivos como el FILE tipo para almacenar una referencia gobernada a cada archivo y sus metadatos en lugar de los bytes del archivo. La tabla de destino expone una file columna que puedes pasar a funciones como ai_parse_document función y a funciones definidas por el usuario (UDFs).
Para usar este FILE tipo, configura lo siguiente en tu pipeline:
- Establece la tubería
channelenPREVIEW. - Establece
file_ingestion_options.formatenFILE. - Establece la
databricks.filespace-previewpropiedad de tabla para declarar el volumen que utiliza Unity Catalog como almacenamiento gestionado.
Agrupaciones de automatización declarativa
resources:
pipelines:
sharepoint_file_pipeline:
name: sharepoint_file_pipeline
channel: PREVIEW
catalog: <catalog>
schema: <schema>
ingestion_definition:
connection_name: <sharepoint-connection>
objects:
- table:
destination_catalog: <catalog>
destination_schema: <schema>
destination_table: <destination-table>
table_configuration:
table_properties:
databricks.filespace-preview: /Volumes/<catalog>/<schema>/<volume>/
connector_options:
sharepoint_options:
entity_type: FILE
url: https://<tenant>.sharepoint.com/sites/<site>
file_ingestion_options:
format: FILE
schema_evolution_mode: NONE
Notebook de Databricks
pipeline_spec = """
{
"name": "<pipeline-name>",
"channel": "PREVIEW",
"catalog": "<catalog>",
"schema": "<schema>",
"ingestion_definition": {
"connection_name": "<sharepoint-connection>",
"objects": [
{
"table": {
"destination_catalog": "<catalog>",
"destination_schema": "<schema>",
"destination_table": "<destination-table>",
"table_configuration": {
"table_properties": {
"databricks.filespace-preview": "/Volumes/<catalog>/<schema>/<volume>/"
}
},
"connector_options": {
"sharepoint_options": {
"entity_type": "FILE",
"url": "https://<tenant>.sharepoint.com/sites/<site>",
"file_ingestion_options": {
"format": "FILE",
"schema_evolution_mode": "NONE"
}
}
}
}
}
]
}
}
"""
create_pipeline(pipeline_spec)
Ingesta de archivos estructurados
Ingerir archivos estructurados (por ejemplo, archivos JSON) desde una carpeta SharePoint. Cada fila de los archivos de origen se convierte en una fila de la tabla de destino.
Agrupaciones de automatización declarativa
resources:
pipelines:
sharepoint_json_pipeline:
name: sharepoint_json_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <sharepoint-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: json_files
connector_options:
sharepoint_options:
entity_type: FILE
url: https://<tenant>.sharepoint.com/sites/<site>/<json_folder>
file_ingestion_options:
format: JSON
schema_evolution_mode: NONE
Notebook de Databricks
pipeline_spec = """
{
"name": "<pipeline-name>",
"catalog": "main",
"schema": "ingest_destination_schema",
"ingestion_definition": {
"connection_name": "<sharepoint-connection>",
"objects": [
{
"table": {
"destination_catalog": "main",
"destination_schema": "ingest_destination_schema",
"destination_table": "json_files",
"connector_options": {
"sharepoint_options": {
"entity_type": "FILE",
"url": "https://<tenant>.sharepoint.com/sites/<site>/<json_folder>",
"file_ingestion_options": {
"format": "JSON",
"schema_evolution_mode": "NONE"
}
}
}
}
}
]
},
"channel": "PREVIEW"
}
"""
create_pipeline(pipeline_spec)
Ingerir solo los metadatos del archivo
Ingerir metadatos de archivo (nombre, tamaño, marcas de tiempo, ruta de acceso) sin descargar el contenido del archivo. Use este enfoque cuando necesite un inventario de archivos sin la sobrecarga de ingerir su contenido.
Agrupaciones de automatización declarativa
resources:
pipelines:
sharepoint_metadata_pipeline:
name: sharepoint_metadata_pipeline
catalog: main
schema: ingest_destination_schema
channel: PREVIEW
ingestion_definition:
connection_name: <sharepoint-connection>
objects:
- table:
destination_catalog: main
destination_schema: ingest_destination_schema
destination_table: file_metadata
connector_options:
sharepoint_options:
entity_type: FILE_METADATA
url: https://<tenant>.sharepoint.com/sites/<site>/<library>
file_ingestion_options:
format: BINARYFILE
schema_evolution_mode: NONE
Notebook de Databricks
pipeline_spec = """
{
"name": "<pipeline-name>",
"catalog": "main",
"schema": "ingest_destination_schema",
"ingestion_definition": {
"connection_name": "<sharepoint-connection>",
"objects": [
{
"table": {
"destination_catalog": "main",
"destination_schema": "ingest_destination_schema",
"destination_table": "file_metadata",
"connector_options": {
"sharepoint_options": {
"entity_type": "FILE_METADATA",
"url": "https://<tenant>.sharepoint.com/sites/<site>/<library>",
"file_ingestion_options": {
"format": "BINARYFILE",
"schema_evolution_mode": "NONE"
}
}
}
}
}
]
},
"channel": "PREVIEW"
}
"""
create_pipeline(pipeline_spec)
Archivo de definición de trabajo de paquetes de automatización declarativa
A continuación se muestra un archivo de definición de trabajo de ejemplo para su uso con agrupaciones de automatización declarativa. La tarea se ejecuta todos los días, exactamente 24 horas después de la ejecución anterior.
Agrupaciones de automatización declarativa
resources:
jobs:
sharepoint_job:
name: sharepoint_job
trigger:
periodic:
interval: 1
unit: DAYS
email_notifications:
on_failure:
- <email-address>
tasks:
- task_key: refresh_pipeline
pipeline_task:
pipeline_id: ${resources.pipelines.sharepoint_binary_pipeline.id}
Configuración de las opciones de ingesta de archivos
El file_ingestion_options bloque controla cómo se procesan los archivos. Todas las opciones se establecen dentro del bloque sharepoint_options.file_ingestion_options en la definición de la canalización.
Filtros de archivo
Use file_filters para restringir los archivos que se ingieren desde la dirección URL de origen:
"file_ingestion_options": {
"format": "CSV",
"file_filters": [
{ "path_filter": "invoices/*.csv" },
{ "modified_after": "2026-01-01T00:00:00" }
]
}
Para consultar la referencia completa de parámetros file_ingestion_options, consulte referencia del conector de Microsoft SharePoint.
Evolución del esquema
Establezca schema_evolution_mode para controlar cómo se gestionan las nuevas columnas en los archivos entrantes. Los modos coinciden con los modos de evolución del esquema del cargador automático. Para más información, consulte la referencia del conector de Microsoft SharePoint.
Sugerencias de esquema
Invalide los tipos de columna deducidos mediante schema_hints:
"file_ingestion_options": {
"format": "CSV",
"schema_hints": "order_id INT, amount DOUBLE, ts TIMESTAMP"
}
Consulte Invalidar la inferencia de esquema con sugerencias de esquema para obtener detalles de uso.
Opciones específicas del formato
Pase opciones específicas del formato mediante format_options:
"file_ingestion_options": {
"format": "CSV",
"format_options": {
"header": "true",
"sep": ","
}
}
Las claves admitidas son las opciones de formato estándar del cargador automático. Consulte Opciones de formato.
Patrones comunes
Para conocer las configuraciones avanzadas de canalización, consulte Patrones comunes para canalizaciones de ingesta administradas.
Pasos siguientes
- Inicie, programe y establezca alertas en su flujo de trabajo. Consulte Tareas comunes de mantenimiento de canalización.
- Puede analizar los documentos sin procesar en texto, fragmentar los datos analizados, crear incrustaciones a partir de los fragmentos, etc. Después, puede usar
readStreamen la tabla de salida directamente en el flujo de trabajo posterior. Consulte Caso de uso de RAG descendente.