Inicio rápido: Consulta y consume datos de OneLake en Microsoft Fabric

En este inicio rápido, usas tres motores Fabric para interactuar con la misma mesa de la casa del lago. Primero, consultas la tabla usando el endpoint de analítica SQL. Luego, creas un informe de Power BI en modo Direct Lake sobre esa misma tabla. Por fin, lees la misma tabla de un cuaderno de Spark. En conjunto, estos pasos muestran el patrón central de OneLake: una copia de datos, varios motores.

OneLake almacena datos tabulares en formato abierto Delta Parquet sobre Azure Data Lake Storage (ADLS) Gen2. Esa base compartida permite que diferentes motores de Fabric trabajen con los mismos datos sin tener que moverlos o reformatearlos para cada experiencia. Las herramientas y servicios que soportan ADLS Gen2, como Azure Databricks, Azure Synapse Analytics y aplicaciones personalizadas, también pueden acceder a los mismos datos desde fuera de Fabric.

Prerrequisitos

Consulta la tabla usando el endpoint de analítica SQL

Cada lakehouse recibe automáticamente un endpoint de análisis SQL. El endpoint lee directamente desde las tablas Delta en OneLake, así que puedes ejecutar consultas T-SQL sobre los datos de Lakehouse sin copiarlos a un almacén SQL separado.

  1. En el portal Fabric, abre el espacio de trabajo que contiene tu casa del lago y selecciona la casa del lago.

  2. En la esquina superior derecha del lakehouse, selecciona Analizar datos con>punto de conexión de análisis SQL en la lista desplegable para cambiar al punto de conexión de análisis SQL del mismo elemento.

    Una captura de pantalla del portal Fabric que muestra el cambio al endpoint de analítica SQL.

  3. En el menú del punto de conexión de análisis SQL, selecciona Nueva consulta SQL.

  4. En el editor de consultas, ejecuta la siguiente consulta sobre la dim_products tabla:

    Esta consulta agrupa por categoría y subcategoría para mostrar el número de productos y el precio medio.

    SELECT
       category,
       subcategory,
       COUNT(*) AS products,
       ROUND(AVG(standard_price), 2) AS avg_price
    FROM (
       SELECT
          product_id,
          category,
          subcategory,
          standard_price,
          ROW_NUMBER() OVER (
             PARTITION BY product_id
             ORDER BY from_date DESC
          ) AS rn
       FROM dbo.dim_products
    ) latest
    WHERE rn = 1
    GROUP BY category, subcategory
    ORDER BY avg_price DESC;
    
  5. Revisa los resultados en el panel de salida de la consulta.

    Una captura de pantalla del portal de Fabric que muestra la salida de una consulta SQL.

Consultabas la tabla sin moverla ni duplicarla. El endpoint de analítica SQL lee los mismos archivos Delta en OneLake que usa la casa del lago.

Crea un informe de Power BI en modo Direct Lake

Direct Lake es un modo de almacenamiento Power BI que lee tablas Delta de OneLake, por lo que un modelo semántico puede servir informes sin importar ni duplicar los datos. Direct Lake tiene dos modos que ambos leen datos de OneLake: Direct Lake en OneLake y Direct Lake en SQL. Difieren en cómo el modelo semántico descubre tablas y hace cumplir permisos. Como este inicio rápido comienza desde el punto de conexión de análisis de SQL, el flujo crea un modelo semántico Direct Lake on SQL.

En esta sección, construyes un modelo semántico y un informe sencillo sobre la misma dim_products tabla.

La vista del informe muestra el precio medio del producto por category, con cada barra dividida por subcategory.

  1. Desde el menú de endpoint de analítica SQL, selecciona Nuevo modelo semántico.

    Una captura de pantalla del portal de Fabric que muestra cómo crear un modelo semántico desde el endpoint de analítica SQL.

  2. Introduce un nombre para el modelo semántico, como dim_products_model. Selecciona la dim_products tabla y luego selecciona Confirmar.

  3. Desde el menú de modelos semánticos, selecciona Nuevo informe.

    Una captura de pantalla del portal Fabric que muestra cómo crear un informe a partir del modelo semántico.

  4. En el entorno de creación de informes, expande la tabla dim_products en el panel Datos.

  5. En el panel de Visualizaciones , selecciona Cuadro de columnas apilado.

    Una captura de pantalla del portal Fabric que muestra cómo seleccionar el gráfico de columnas apiladas.

  6. Arrastra category al eje X.

  7. Arrastra standard_price al eje Y, luego pon la agregación en Promedio.

  8. Arrastra subcategory a Leyenda para dividir cada categoría en subcategorías.

    Una captura de pantalla del portal de Fabric que muestra los resultados de los pasos de construcción del informe.

  9. En la cinta de opciones, selecciona Archivo>Guardar y guarda el informe en tu espacio de trabajo.

El informe se lee desde la misma tabla Delta en OneLake que acabas de consultar con T-SQL. No creaste una segunda copia de los datos para alimentar el informe.

Lee la misma tabla desde un cuaderno de Spark

Los cuadernos de Fabric ofrecen un tercer motor con los mismos datos. Spark lee la dim_products tabla Delta directamente de OneLake, sin pasar por el endpoint de analítica SQL ni por el modelo semántico. Este paso muestra que un motor con una pila de consultas completamente diferente funciona a partir de los mismos archivos subyacentes.

  1. Vuelve a la casa del lago que contiene dim_products.

  2. En el menú del lakehouse, selecciona Analizar datos con>Bloc de notas>Nuevo bloc de notas. El cuaderno se abre con tu casa del lago ya adjunta como la casa predeterminada.

  3. En la primera celda de código, pega el siguiente código PySpark:

    Este código se utiliza from_date como dimensión temporal y resume el recuento de productos y el precio medio por periodo y categoría.

    from pyspark.sql import functions as F
    
    df = spark.read.table("dim_products")
    
    summary = (
       df.groupBy("from_date", "category")
       .agg(
          F.count("*").alias("products"),
          F.round(F.avg("standard_price"), 2).alias("avg_price"),
       )
       .orderBy(F.col("from_date"), F.col("avg_price").desc())
    )
    
    display(summary)
    
  4. Selecciona Ejecutar celda (o pulsa Shift+Enter) para ejecutar la celda. El resultado muestra cómo los precios medios varían según las categorías a lo largo de las fechas de vigencia.

    Una captura de pantalla del portal de Fabric que muestra los resultados del código del cuaderno.

Spark lee directamente los archivos Delta en OneLake. No se copian datos en un almacén específico de Spark, y la tabla que consultaste es la misma que respalda tu modelo semántico. Ahora tienes una copia de datos en OneLake que tres motores —el endpoint de análisis SQL, Power BI Direct Lake y Spark— utilizan mediante almacenamiento abierto y un formato de tabla abierta, sin mover ni reformatear los datos.

Limpieza de recursos

Si no planeas seguir usando el modelo semántico, el informe y el cuaderno, elimínalos de tu espacio de trabajo:

  1. En tu espacio de trabajo, pasa el cursor sobre el modelo semántico que creaste y selecciona el menú de más opciones (...), luego selecciona Eliminar.
  2. Repite esto para el informe y el cuaderno de tu espacio de trabajo.

Eliminar el informe, el modelo semántico o el cuaderno de notas no afecta al lakehouse subyacente ni a la tabla dim_products.