Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Aplica-se a:
SQL Server 2019 e anteriores Analysis Services
Azure Analysis Services
Fabric/Power BI Premium
Importante
A mineração de dados foi preterida no SQL Server 2017 Analysis Services e agora descontinuada no SQL Server 2022 Analysis Services. A documentação não é atualizada para recursos preteridos e descontinuados. Para saber mais, consulte Compatibilidade com versões anteriores do Analysis Services.
O algoritmo Microsoft Association Rules é uma implementação direta do conhecido algoritmo Apriori.
Tanto o algoritmo das Árvores de Decisão da Microsoft como o algoritmo das Regras de Associação da Microsoft podem analisar associações, mas as regras que cada algoritmo encontra podem ser diferentes. Num modelo de árvores de decisão, o ganho de informação determina as divisões que conduzem a regras específicas. Num modelo de associação, a confiança determina completamente as regras. Portanto, num modelo de associação, uma regra forte, ou uma que tenha alta confiança, pode não ser necessariamente interessante porque não fornece nova informação.
Implementação do Algoritmo de Associação da Microsoft
O algoritmo Apriori não analisa padrões. Em vez disso, gera e depois conta os itens candidatos. Um item pode representar um evento, um produto ou o valor de um atributo, dependendo do tipo de dados que analisa.
No modelo de associação mais comum, atribui-se variáveis booleanas, que representam um valor Sim/Não ou Em Falta/Existente, a cada atributo, como um nome de produto ou evento. Uma análise de cesta de mercado é um exemplo de modelo de regras de associação que utiliza variáveis booleanas para representar a presença ou ausência de determinados produtos no cesto de compras de um cliente.
Para cada itemset, o algoritmo cria pontuações que representam apoio e confiança. Pode usar estas pontuações para classificar e derivar regras interessantes a partir dos conjuntos de itens.
Também pode criar modelos de associação para atributos numéricos. Se os atributos forem contínuos, podes discretizar ou agrupar os números em baldes. Pode tratar os valores discretizados como booleanos ou como pares atributo-valor.
Apoio, probabilidade e importância
Suporte, por vezes designado por frequência, corresponde ao número de casos que contêm o item visado ou a combinação de itens. O modelo só pode incluir itens que tenham pelo menos o nível de suporte especificado.
Um conjunto frequente de itens é uma coleção de itens onde a combinação de itens também tem suporte acima do limiar definido pelo parâmetro MINIMUM_SUPPORT. Por exemplo, se o conjunto de itens for {A,B,C} e o valor de APOIO_MÍNIMO for 10, cada item individual A, B e C deve ser encontrado em pelo menos 10 casos para ser incluído no modelo, assim como a combinação de itens {A,B,C} também deve ser encontrada em pelo menos 10 casos.
Observação
Também podes controlar o número de conjuntos de itens num modelo de mineração especificando o comprimento máximo de um conjunto de itens, onde comprimento significa o número de itens.
Por predefinição, o suporte para qualquer item específico ou conjunto de itens corresponde ao número de casos que contêm esse item ou esses itens. No entanto, também pode expressar MINIMUM_SUPPORT como percentagem do total de casos no conjunto de dados, digitando o número como um valor decimal inferior a 1. Por exemplo, se especificar um valor MINIMUM_SUPPORT de 0,03, significa que pelo menos 3% do total de casos no conjunto de dados devem conter este item ou conjunto de itens para inclusão no modelo. Experimente o seu modelo para determinar se usar uma contagem ou percentagem faz mais sentido.
Em contraste, o limiar para regras é expresso não como uma contagem ou percentagem, mas como uma probabilidade, por vezes referida como confiança. Por exemplo, se o conjunto de itens {A,B,C} ocorre em 50 casos, mas o conjunto de itens {A,B,D} também ocorre em 50 casos, e o conjunto de itens {A,B} em outros 50 casos, é óbvio que {A,B} não é um preditor forte de {C}. Assim, para ponderar um determinado resultado contra todos os resultados conhecidos, o SQL Server Analysis Services calcula a probabilidade da regra individual (como Se {A,B} Então {C}) dividindo o suporte ao itemset {A,B,C} pelo suporte a todos os itemsets relacionados.
Pode restringir o número de regras que um modelo produz definindo um valor para MINIMUM_PROBABILITY.
Para cada regra que cria, o SQL Server Analysis Services atribui uma pontuação que indica a sua importância, também designada por lift. A importância do levantamento é calculada de forma diferente para conjuntos de itens e regras.
A importância de um conjunto de itens é calculada como a probabilidade do conjunto dividida pela probabilidade composta dos itens individuais no itemet. Por exemplo, se um itemet contém {A,B}, o SQL Server Analysis Services conta primeiro todos os casos que contêm esta combinação A e B, divide essa contagem pelo número total de casos e depois normaliza a probabilidade.
A importância de uma regra é calculada pela probabilidade logarítmica do lado direito da regra, dado o lado esquerdo da regra. Por exemplo, na regra If {A} Then {B}, o SQL Server Analysis Services calcula a razão de casos com A e B sobre casos com B mas sem A, e depois normaliza essa razão usando uma escala logarítmica.
Seleção de funcionalidades
O algoritmo das Regras de Associação da Microsoft não realiza qualquer tipo de seleção automática de funcionalidades. Em vez disso, o algoritmo fornece parâmetros que controlam os dados que o algoritmo utiliza. Este controlo pode incluir limites no tamanho de cada itemset, ou definir o suporte máximo e mínimo necessário para adicionar um itemset ao modelo.
Para filtrar itens e eventos que são demasiado comuns e, portanto, pouco interessantes, diminui o valor da MAXIMUM_SUPPORT para remover conjuntos de itens muito frequentes do modelo.
Para filtrar itens e conjuntos de itens raros, aumente o valor de MINIMUM_SUPPORT.
Para filtrar regras, aumenta o valor da MINIMUM_PROBABILITY.
Personalização do Algoritmo de Regras de Associação Microsoft
O algoritmo Microsoft Association Rules suporta vários parâmetros que afetam o comportamento, desempenho e precisão do modelo de mineração resultante.
Definição de parâmetros do algoritmo
Pode alterar os parâmetros de um modelo de mineração a qualquer momento usando o Data Mining Designer no SQL Server Data Tools. Também pode alterar parâmetros programaticamente usando a coleção AlgorithmParameters no AMO, ou usando o elemento MiningModels (ASSL) no XMLA. A tabela a seguir descreve cada parâmetro.
Observação
Não podes alterar os parâmetros num modelo existente usando uma instrução DMX. Tem de especificar os parâmetros em DMX CREATE MODEL ou ALTER STRUCTURE... ADD MODEL ao criar o modelo.
MAXIMUM_ITEMSET_COUNT
Especifica o número máximo de conjuntos de itens a produzir. Se não especificar um número, é usado o valor padrão.
O padrão é 200000.
Observação
Os conjuntos de itens são classificados por suporte. Entre conjuntos de itens que têm o mesmo suporte, a ordem é arbitrária.
MAXIMUM_ITEMSET_SIZE
Especifica o número máximo de itens permitidos num conjunto de itens. Definir este valor para 0 especifica que não há limite para o tamanho do conjunto de itens.
O padrão é 3.
Observação
Diminuir este valor pode potencialmente reduzir o tempo necessário para a criação do modelo, porque o processamento do modelo para ao atingir o limite.
MAXIMUM_SUPPORT
Especifica o número máximo de casos que um conjunto de itens tem para suporte. Use este parâmetro para eliminar itens que aparecem frequentemente e, por isso, podem ter pouco significado.
Se definir este valor para menos de 1, o valor representa uma percentagem do total de casos. Valores superiores a 1 representam o número absoluto de casos que podem conter o conjunto de itens.
O padrão é 1.
MINIMUM_ITEMSET_SIZE
Especifica o número mínimo de itens permitidos num conjunto de itens. Se aumentar este número, o modelo pode conter menos conjuntos de itens. Esta alteração pode ser útil se quiseres ignorar conjuntos de um único item, por exemplo.
O padrão é 1.
Observação
Não se pode reduzir o tempo de processamento do modelo aumentando o valor mínimo, porque o SQL Server Analysis Services tem de calcular probabilidades para itens individuais de qualquer forma como parte do processamento. No entanto, ao definir este valor mais alto, pode filtrar itens mais pequenos.
MINIMUM_PROBABILITY
Especifica a probabilidade mínima de uma regra ser verdadeira.
Por exemplo, se definir este valor para 0,5, significa que nenhuma regra com menos de cinquenta por cento de probabilidade pode ser gerada.
O padrão é 0,4.
MINIMUM_SUPPORT
Especifica o número mínimo de casos que devem conter o itemet antes de o algoritmo gerar uma regra.
Se definir este valor para menos de 1, o número mínimo de casos é calculado como percentagem do total de casos.
Se definir este valor para um número inteiro superior a 1, estará a especificar que o número mínimo de casos deve ser calculado como uma contagem de casos que devem conter o itemset. O algoritmo pode aumentar automaticamente o valor deste parâmetro se a memória for limitada.
O padrão é 0,03. Este valor significa que, para ser incluído no modelo, um itemset deve ser encontrado em pelo menos 3% dos casos.
OPTIMIZED_PREDICTION_COUNT
Define o número de itens a armazenar em cache para otimizar a previsão.
O valor padrão é 0. Quando o padrão é usado, o algoritmo produz tantas previsões quanto solicitadas na consulta.
Se especificar um valor não nulo para OPTIMIZED_PREDICTION_COUNT, as consultas de previsão podem devolver no máximo o número especificado de itens, mesmo que peça previsões adicionais. No entanto, definir um valor pode melhorar o desempenho da previsão.
Por exemplo, se definir o valor em 3, o algoritmo armazena apenas três itens para previsão. Não consegues ver outras previsões que possam ser tão prováveis quanto os três itens que o algoritmo devolve.
Bandeiras de modelação
O algoritmo das Regras de Associação da Microsoft suporta as seguintes bandeiras de modelação.
NÃO NULO
Indica que a coluna não pode conter um nulo. Se o SQL Server Analysis Services encontrar um nulo durante o treino do modelo, devolve um erro.
Aplica-se à coluna da estrutura de mineração.
Existência_Apenas_Modelo
Trata a coluna como tendo dois estados possíveis: Ausente e Existente. Um valor nulo é um valor em falta.
Aplica-se à coluna do modelo de mineração.
Requerimentos
Um modelo de associação deve conter uma coluna chave, colunas de entrada e uma única coluna previsível.
Colunas de entrada e de previsão
O algoritmo Microsoft Association Rules suporta as colunas de entrada específicas e as colunas previsíveis que estão listadas na tabela seguinte. Para mais informações sobre o significado dos tipos de conteúdo num modelo de mineração, consulte Tipos de Conteúdo (Mineração de Dados).
| Coluna | Tipos de conteúdo |
|---|---|
| Atributo de entrada | Cíclico, Discreto, Discretizado, Chave, Tabela, Ordenado |
| Atributo previsível | Cíclico, Discreto, Discretizado, Tabela, Ordenado |
Observação
O algoritmo suporta tipos de conteúdo Cíclico e Ordenado, mas trata-os como valores discretos e não realiza processamento especial.
Ver também
Algoritmo de Associação Microsoft
Exemplos de Consultas de Modelos de Associação
Mineração de Conteúdo de Modelos para Modelos de Associação (Serviços de Análise - Mineração de Dados)