Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Se aplica a:
SQL Server 2019 y versiones anteriores de Analysis Services
Azure Analysis Services
Fabric/Power BI Premium
Importante
La minería de datos estaba en desuso en SQL Server 2017 Analysis Services y ahora se descontinuó en SQL Server 2022 Analysis Services. La documentación no se actualiza para las características en desuso y descontinuadas. Para más información, consulte Compatibilidad con versiones anteriores de Analysis Services.
La creación de un modelo de minería de datos basado en un cubo OLAP u otro almacén de datos multidimensional tiene muchas ventajas. Una solución OLAP ya contiene grandes cantidades de datos bien organizados, limpios y con formato correcto. Sin embargo, la complejidad de los datos dificulta la búsqueda de patrones significativos a través de la exploración ad hoc. La minería de datos proporciona la capacidad de detectar nuevas correlaciones y conclusiones accionables.
En este artículo se describe cómo crear una estructura de minería de datos OLAP basada en una dimensión y medidas relacionadas en una solución multidimensional existente.
Requisitos para modelos y estructura de minería de datos OLAP
Al diseñar un modelo de minería de datos OLAP, el origen de datos ya existe en la base de datos que se usa para compilar el cubo. No se puede conectar a un cubo remoto ni crear objetos de minería de datos. Debe disponer de los objetos de cubo y la base de datos en la misma solución que la estructura de minería que cree.
Si no tiene los archivos de proyecto originales o no quiere modificarlos, puede usar la opción Importar desde servidor (multidimensional o minería de datos) en Visual Studio para obtener una copia de los metadatos y los objetos de solución. A continuación, puede modificar el destino de implementación, editar orígenes de datos y trabajar con los objetos de cubo sin afectar a los objetos existentes.
Para obtener más información, consulte Importación de un proyecto de minería de datos mediante el Asistente para importación de Analysis Services.
Información general sobre el proceso de minería de datos OLAP
Inicie el Asistente para minería de datos haciendo clic con el botón derecho en el nodo Estructuras de minería de datos de Explorador de soluciones y seleccionando Nueva estructura de minería de datos. El asistente le guiará por los siguientes pasos para crear la estructura de una nueva estructura y modelo:
Seleccione el Método de definición: seleccione un tipo de origen de datos y elija En el cubo existente.
Nota:
El cubo OLAP que utilices como fuente debe encontrarse en la misma base de datos que la estructura de minería de datos. Además, no puede usar un cubo creado por Power Pivot para complemento de Excel como origen de minería de datos.
Crear la estructura de minería de datos: determine si se va a crear solo una estructura o una estructura con un modelo de minería de datos.
También debe elegir un algoritmo adecuado para analizar los datos. Para obtener instrucciones sobre qué algoritmo es mejor para determinadas tareas, consulte Algoritmos de minería de datos (Analysis Services - Minería de datos).
Seleccione la dimensión de cubo de origen: este paso es el mismo que seleccionar un origen de datos. Elija la dimensión única que contiene los datos más importantes que se usan para entrenar el modelo. Puede agregar datos de otras dimensiones o filtrar la dimensión más adelante.
Seleccione la clave de caso: dentro de la dimensión que acaba de seleccionar, elija una columna de atributo para que actúe como identificador único para los datos del caso.
Normalmente, se preselecciona una columna, pero puede cambiarla si hay varias claves.
Seleccionar columnas de nivel de caso: elija los atributos y las medidas relacionadas de la dimensión seleccionada que son relevantes para el análisis. Este paso equivale a seleccionar columnas de una tabla.
El asistente incluye automáticamente todas las medidas creadas a partir de atributos de la dimensión seleccionada para que las revise y seleccione.
Por ejemplo, si el cubo contiene una medida que calcula el costo de flete en función de la ubicación geográfica del cliente y eligió la dimensión Customer como origen de datos principal para el modelado, la medida se propone como candidata para agregar al modelo. Evite agregar demasiadas medidas que ya se basan directamente en atributos. Ya hay una relación implícita entre las columnas, tal como se define en la fórmula de medida, y la intensidad de esta correlación esperada puede ocultar otras relaciones que podría detectar.
Especificar el uso de las columnas del modelo de minería de datos: para cada atributo o medida que añadió a la estructura, debe especificar si el atributo se debe usar para predicción o como entrada. Si no selecciona ninguna de estas opciones, los datos se procesan pero no se usan para el análisis. Los datos están disponibles como datos de fondo por si más adelante activas la función de desglose.
Agregar tablas anidadas: seleccione esta opción para agregar tablas relacionadas.
En el cuadro de diálogo Seleccionar una dimensión de grupo de medida, elija una sola dimensión de las dimensiones relacionadas con la dimensión actual.
Use el cuadro de diálogo Seleccionar una clave de tabla anidada para definir cómo está relacionada la nueva dimensión con la dimensión que contiene los datos de casos.
Use el cuadro de diálogo Seleccionar columnas de tabla anidada para elegir los atributos y medidas de la nueva dimensión que desea usar en el análisis. Especifique también si el atributo anidado se usa para predicción.
Después de agregar todos los atributos anidados que necesite, vuelva a la página Especificar el uso de columnas del modelo de minería y seleccione Siguiente.
Especificar contenido de columnas y tipo de datos: después de agregar todos los datos que se van a usar para el análisis, especifique el tipo de datos y el tipo de contenido para cada atributo.
En un modelo OLAP, no tiene la opción de detectar automáticamente tipos de datos, ya que el tipo de datos ya está definido por la solución multidimensional y no se puede cambiar. Las claves también se identifican automáticamente. Para obtener más información, consulte Tipos de datos (minería de datos).
El tipo de contenido que elija para cada columna que use en el modelo indica al algoritmo cómo se deben procesar los datos. Para obtener más información, vea Tipos de contenido (minería de datos).
Segmentación del cubo de origen: defina filtros en el cubo para seleccionar solo un subconjunto de datos con el que entrenar modelos más específicos.
Para filtrar un cubo, elija la dimensión en la que filtrar, seleccione el nivel de la jerarquía que contiene los criterios que desea usar y, a continuación, escriba una condición para usarla como filtro.
Crear conjunto de pruebas: seleccione la cantidad de datos que se deben reservar para usarlas en las pruebas del modelo. Si los datos admiten varios modelos, es recomendable crear un conjunto de datos de espera para que todos los modelos se puedan probar en los mismos datos.
Para obtener más información, vea Testing and Validation (Data Mining).
Finalización del Asistente: asigne un nombre a la nueva estructura de minería de datos y al modelo de minería de datos asociado y guarde la estructura y el modelo.
En esta página, también puede establecer las siguientes opciones:
Permitir desglose
Crear dimensión del modelo de minería
Crear cubo utilizando la dimensión del modelo de minería de datos
Para obtener más información sobre estas opciones, consulte Descripción general de las dimensiones de minería de datos y la exploración en profundidad más adelante en este artículo.
En este momento, la estructura de minería de datos y su modelo son solo metadatos. Debe procesar ambos para obtener resultados.
Escenarios para usar la minería de datos con datos OLAP
Los cubos OLAP suelen contener tantos miembros y dimensiones que es difícil saber dónde comenzar con la minería de datos. Para ayudar a identificar los patrones que contienen los cubos, puede identificar una sola dimensión de interés y empezar a explorar patrones relacionados con esa dimensión. En la tabla siguiente se enumeran varias tareas comunes de minería de datos OLAP, se describen escenarios de ejemplo para aplicar cada tarea e identifica el algoritmo de minería de datos que se va a usar para cada tarea.
| Tarea | Escenario de ejemplo | Algoritmo |
|---|---|---|
| Agrupar miembros en clústeres | Segmente una dimensión de cliente en función de las propiedades de los miembros del cliente, los productos que compran los clientes y la cantidad de dinero que gastan los clientes. | Algoritmo de agrupación en clústeres de Microsoft |
| Buscar miembros interesantes o anómalos | Identifique tiendas interesantes o anómalas en una dimensión de tienda en función de las ventas, las ganancias, la ubicación de la tienda y el tamaño de la tienda. | Algoritmo de árboles de decisión de Microsoft |
| Buscar células interesantes o anómalas | Identifique las ventas de la tienda que van en contra de las tendencias típicas a lo largo del tiempo. | Algoritmo de serie temporal de Microsoft |
| Búsqueda de correlaciones | Identifique los factores relacionados con el tiempo de inactividad del servidor, incluida la región, el tipo de máquina, el sistema operativo o la fecha de compra. | Algoritmo bayes naïve de Microsoft |
Cortar un cubo frente a filtrar modelos
Segmentar el cubo mientras crea un modelo es como crear un filtro en un modelo de minería de datos relacional. En un modelo relacional, el filtro del origen de datos se define como una cláusula WHERE en una instrucción SQL. En un cubo, se usa el editor para crear instrucciones de filtro mediante MDX.
Por ejemplo, un cubo puede contener información sobre las compras de productos en todo el mundo, pero para su campaña de marketing, quiere crear un modelo basado en el análisis de clientes femeninos de más de 30 que viven en el Reino Unido. En este escenario, creará dos filtros:
Para el primer filtro, elija la dimensión Geography , elija la jerarquía de Region y, a continuación, use la lista Expresión de filtro para elegir Reino Unido entre los valores posibles.
Para el segundo filtro, elija la dimensión Customer , seleccione el atributo Gender y seleccione Female en la lista de valores de atributo.
Una vez creada la estructura de minería de datos, puedes modificar tanto la definición de los datos del cubo como los criterios de filtrado. Para obtener más información, vea Filtros para modelos de minería de datos.
Tanto la pestaña Estructura de minería de datos como la pestaña Modelo de minería de datos proporcionan una opción para agregar un filtro a una estructura de minería de datos existente seleccionando Definir un segmento de cubo. El cuadro de diálogo Slice Cube (Cubo de segmento ) le ayuda a crear una expresión de filtro MDX válida eligiendo valores de las listas desplegables.
Importante
La interfaz para diseñar y examinar cubos cambió en SQL Server 2017. Para obtener más información, vea Examinar datos y metadatos en Cube.
Puede agregar tantos filtros en el cubo como sean necesarios para obtener los datos que necesita para el modelo de minería. También puede definir segmentos en segmentos de cubo individuales. Por ejemplo, si la estructura contiene dos tablas anidadas basadas en productos, podría segmentar una tabla en marzo de 2004 y la otra tabla en abril de 2004. A continuación, el modelo resultante podría usarse para predecir las compras realizadas en abril en función de las compras realizadas en marzo.
Uso de tablas anidadas en un modelo de minería de datos OLAP
Al usar el Asistente para minería de datos para crear un modelo basado en datos de cubo, puede agregar tablas anidadas especificando los nombres de dimensiones relacionadas y, a continuación, eligiendo los atributos o medidas que se van a agregar al modelo.
Por ejemplo, si la dimensión principal utilizada para los datos de casos es Cliente, puede agregar la dimensión Productos como dimensión relacionada, ya que cabe esperar que un cliente pida varios productos a lo largo del tiempo y el cubo ya vincula a cada cliente con múltiples productos a través de las tablas de hechos de pedidos.
Agrega tablas anidadas en la página Especificar el uso de columnas del modelo de minería del asistente seleccionando Agregar tablas anidadas. Se abre un cuadro de diálogo que le guía por el proceso de elección de una dimensión relacionada y cualquier medida. El caso y las dimensiones anidadas se deben relacionar mediante una clave externa, y las medidas deben utilizar uno de los atributos que ya están incluidos en el caso o en las tablas anidadas. Estas restricciones no limitan mucho el ámbito, por lo que debe tener cuidado de seleccionar solo los atributos que son útiles para el modelado.
Para cada atributo o medida que agregue a la tabla anidada, debe especificar si el atributo anidado se usa para la predicción seleccionando Predicción o Entrada en el cuadro de diálogo Seleccionar columnas de tabla anidadas . Si no seleccionas ninguna de estas opciones, los datos se añaden a la estructura de minería de datos, pero no se utilizan para el análisis.
Para cada atributo y medida, también debe especificar si el atributo es discreto, discretizado o continuo. El asistente preselecciona un valor predeterminado basado en el tipo de datos del atributo, pero es posible que tenga que cambiar estos valores en función de los requisitos del algoritmo. Si elige un tipo de contenido que no es compatible con el algoritmo que elija, por ejemplo, usa un tipo numérico continuo con un modelo Bayes naïve, recibirá un mensaje de error al intentar procesar el modelo.
Cuando termines de configurar estas opciones, el asistente añadirá la tabla anidada a la tabla de casos. El nombre predeterminado de la tabla anidada es el nombre de la dimensión anidada, pero puede cambiar el nombre de la tabla anidada y sus columnas. Puede repetir este proceso para agregar varias tablas anidadas a la estructura de minería.
La capacidad de usar datos de tablas anidadas es una característica de la minería de datos de SQL Server especialmente potente, y ofrece posibilidades casi ilimitadas para usar subconjuntos de datos relacionados en un cubo.
Descripción de las dimensiones de minería de datos y el desglose
La opción Permitir exploración en profundidad permite ejecutar consultas en los datos del cubo subyacente mientras examina el modelo. Los datos no están incluidos en la nueva dimensión de minería de datos, pero la base de datos de SQL Server Analysis Services puede usar los enlaces de datos para recuperar la información del cubo de origen.
La opción Crear dimensión del modelo de minería de datos te permite generar una nueva dimensión dentro del cubo existente que contenga los patrones descubiertos por el algoritmo. El tipo de modelo determina en gran medida la jerarquía dentro de la nueva dimensión. Por ejemplo, la representación de un modelo de agrupación en clústeres es bastante plana, con el nodo (All) en la parte superior de la jerarquía y cada clúster del siguiente nivel. En cambio, la dimensión que se crea para un modelo de árbol de decisión puede tener una jerarquía muy profunda, que representa la bifurcación del árbol.
La opción Crear cubo mediante la dimensión del modelo de minería de datos permite exportar la nueva dimensión de minería de datos a un nuevo cubo. Los objetos necesarios para la exploración en profundidad en la dimensión de minería de datos se incluyen automáticamente.
Importante
Solo los tipos de modelo basados en el algoritmo de agrupación en clústeres de Microsoft, el algoritmo de árboles de decisión de Microsoft o el algoritmo de asociación de Microsoft admiten la creación de dimensiones de minería de datos.
Consulte también
Algoritmos de minería de datos (Analysis Services - Minería de datos)
Columnas de la estructura de minería
Columnas del modelo de minería
Propiedades del modelo de minería de datos
Propiedades de la estructura de minería y de las columnas de estructura