Projetos relacionados para soluções de mineração de dados

Aplica-se a: SQL Server 2019 e anteriores Analysis Services Azure Analysis Services Fabric/Power BI Premium

Importante

A mineração de dados foi preterida no SQL Server 2017 Analysis Services e agora descontinuada no SQL Server 2022 Analysis Services. A documentação não é atualizada para recursos preteridos e descontinuados. Para saber mais, consulte Compatibilidade com versões anteriores do Analysis Services.

O mínimo exigido para uma solução de mineração de dados é o projeto de mineração de dados, que define fontes de dados, vistas de fontes de dados, estruturas de mineração e modelos de mineração. No entanto, quando os modelos de mineração de dados são usados na tomada de decisão diária, é importante que a mineração de dados seja integrada com outras partes de uma solução de análise preditiva, que pode incluir estes processos e componentes:

  • Preparação e seleção de dados e de variáveis. Inclui limpeza de dados, gestão de metadados e integração de múltiplas fontes de dados, bem como a conversão, fusão e carregamento de dados para um armazém de dados.

  • Relatórios de análise, apresentação de previsões e auditoria/acompanhamento das atividades de mineração de dados.

  • Utilização de modelos multidimensionais ou tabulares para explorar as descobertas.

  • Refinamento da solução de mineração de dados para suportar novos dados, ou alterações na infraestrutura de suporte impulsionadas pela análise atual.

Este tópico descreve as outras funcionalidades do SQL Server 2017 que frequentemente fazem parte de uma solução de análise preditiva, seja para apoiar os processos de preparação e mineração de dados, seja para apoiar os utilizadores fornecendo ferramentas para análise e ação.

Serviços de Integração

Serviços de Relatório

Serviço de Qualidade de Dados

Full-Text Pesquisa

Indexação Semântica

SQL Server Integration Services

Os Serviços de Integração fornecem componentes e funcionalidades necessários para as fases de preparação e treino de dados de um projeto de mineração de dados. Embora possa realizar muitas tarefas de limpeza ou preparação de dados utilizando outras ferramentas, como scripts, os Serviços de Integração têm inúmeras vantagens para a mineração de dados:

  • Representa tarefas como parte de um fluxo de trabalho, que pode ser repetido, automatizado, ramificado e estendido.

  • Fornece suporte extenso para auditorias e múltiplas formas de capturar erros e registar eventos.

    Para além de captar a linhagem dos dados, pode monitorizar alterações aos dados ao longo do pipeline de transformação dos dados.

    Também pode integrar os seus fluxos de trabalho SSIS com as funcionalidades que suportam a funcionalidade de Captura de Alterações de Dados no SQL Server.

  • A mineração de dados pode ser incorporada no fluxo de trabalho dos Serviços de Integração, para separar inteligentemente os dados recebidos em múltiplas tabelas. Por exemplo, pode usar uma consulta de previsão para dividir novos clientes em diferentes grupos para segmentação numa campanha de correio.

As listas seguintes fornecem ligações para os componentes de Serviços de Integração mais amplamente utilizados no apoio à mineração de dados.

Componentes de Controlo do Fluxo

Componentes do Fluxo de Dados

Serviços de Relatórios SQL Server

Embora os Serviços de Relatórios normalmente não sejam vistos como um componente crítico das soluções de mineração de dados, fornecem as seguintes funcionalidades úteis para a apresentação de soluções de mineração de dados.

  • Integração de dados de múltiplas fontes em relatórios complexos. Crie consultas sobre o conteúdo do modelo para analistas, e relatórios que mostrem previsões e tendências para os utilizadores finais.

  • A capacidade de criar um relatório que permite aos utilizadores consultar diretamente um modelo de mineração existente.

  • Integração com o SQL Server Analysis Services, para suportar a perfuração detalhada e a exploração de dimensões e cubos de mineração de dados criados a partir de modelos OLAP.

  • funcionalidades de parametrização e formatação disponíveis nos Serviços de Relatório.

Para mais informações sobre como usar Serviços de Relatórios com consultas DMX como fonte de dados, consulte estes links:

Recuperar Dados de um Modelo de Mineração de Dados (DMX) (SSRS)

Interface de Utilizador do Designer de Consultas DMX dos Serviços de Análise

Tipo de Conexão dos Serviços de Análise para DMX (SSRS)

No entanto, não é necessário usar DMX como fonte de dados. Os componentes dos Serviços de Integração para mineração de dados também suportam guardar os resultados de uma consulta de previsão numa base de dados relacional. Se tiver um fluxo de trabalho estabelecido para atualizar modelos usando Integration Services, previsões persistentes e outros resultados de consultas de mineração de dados para SQL Server permitem-lhe usar o Power View para relatórios, bem como outras ferramentas que não interagem com DMX.

Para mais informações sobre a utilização dos Serviços de Relatórios como camada de apresentação para fontes de dados, consulte Integração dos Serviços de Relatórios nas Aplicações.

Serviços de qualidade de dados

Os Serviços de Qualidade de Dados (DQS) são novidades no SQL Server 2017. Como problemas de dados podem tornar a mineração de dados impossível, espera-se que os mineradores de dados que realizem análises repetidas ou que trabalham em grandes organizações com fontes de dados complexas descubram que um projeto de dados bem planeado usando DQS é uma solução mais fiável para o suporte à mineração de dados do que a limpeza ad hoc de dados usando Transact-SQL ou outros scripts.

As seguintes características do DQS devem ser consideradas para preparação e integridade de dados numa solução de mineração de dados.

Um processo de limpeza de dados assistido por computador que analisa os dados de origem e propõe alterações.
O DQS pode comparar dados de origem com dados de referência baseados na cloud mantidos e garantidos por fornecedores de qualidade de dados.

O DQS também pode analisar dados de origem bruta e criar uma base de conhecimento a partir dos dados do utilizador. Os dados processados são categorizados e depois exibidos ao utilizador para processamento adicional. O processo de limpeza é interativo, o que significa que o gestor de dados pode aprovar, rejeitar ou modificar os dados propostos pelo processo de limpeza assistida por computador.

O resultado do processo é uma base de conhecimento que pode melhorar continuamente ou reutilizar em múltiplas fases de melhoria de dados.

Para obter mais informações, consulte Limpeza de Dados.

Um processo de correspondência assistido por computador que analisa os dados de origem e propõe alterações.
Para evitar duplicação de dados, pode realizar uma limpeza por adição da fonte de dados, para identificar correspondências exatas e aproximadas. Estes componentes permitem-lhe especificar as regras de correspondência e os limiares a partir dos quais as aplicar.

Ao encontrar correspondências de dados, pode remover duplicados, o que pode ser um problema para a mineração de dados. A desduplicação de dados não é automática; o gestor de dados ou profissional de TI deve verificar tanto o conhecimento da base de conhecimento como as alterações a fazer aos dados.

Depois de criar o projeto inicial do DQS, pode automatizar muitas das tarefas utilizando componentes dos Serviços de Integração.

Para obter mais informações, consulte de correspondência de dados.

Ao realizar atividades de limpeza e correspondência num projeto de qualidade de dados, pode obter estatísticas e informações em tempo real sobre os dados que estão a ser processados pelo DQS. A análise de dados ajuda-o a avaliar até que ponto a limpeza ou correspondência de dados ajudou a melhorar a qualidade dos dados e a compreender as alterações que foram feitas. Para informações sobre perfilagem de dados e notificações, consulte Perfilagem de Dados e Notificações no DQS.

Uma base de conhecimento que representa três tipos de conhecimento: conhecimento pronto, conhecimento gerado pelo servidor DQS e conhecimento gerado pelo utilizador.
Depois de criar uma base de conhecimento, pode usá-la iterativamente para limpar e verificar outros dados.

Pode importar novos dados para a base de conhecimento a partir de múltiplas fontes, seja dados limpos conhecidos de fornecedores de referência, ou dados brutos que sejam comparados com dados existentes na base de conhecimento.

Para informações detalhadas sobre a atividade de limpeza num projeto de qualidade de dados, consulte Limpeza de Dados (DQS).

Também pode aplicar o conhecimento da base de conhecimento a outras fontes, para realizar limpeza de dados noutros processos. Esta limpeza de dados pode ajudar a identificar erros de introdução do utilizador, corrupção na transmissão ou armazenamento, ou definições de dicionário de dados inadequadas.

Para obter mais informações, consulte Bases de conhecimento e domínios do DQS.

Pesquisa de Texto Completo

Pesquisa de Texto Completo no SQL Server permite que aplicações e utilizadores executem consultas em texto completo sobre dados de caracteres nas tabelas do SQL Server. Quando a pesquisa em texto completo está ativada, pode realizar pesquisas em dados textuais que são melhoradas por regras específicas da língua sobre as múltiplas formas de uma palavra ou expressão. Também pode configurar condições de pesquisa, como a distância entre múltiplos termos, e usar funções para restringir os resultados que são devolvidos por ordem de verosimilhança.

Como as consultas em texto completo são uma funcionalidade fornecida pelo motor SQL Server, pode criar consultas parametrizadas, gerar conjuntos de dados personalizados ou vetores de termos usando funcionalidades de pesquisa em texto completo numa fonte de dados de texto, e usar essas fontes na mineração de dados.

Para mais informações sobre como as consultas em texto completo interagem com o índice em texto completo, consulte Consulta com Pesquisa de Texto Completo.

Uma vantagem de usar as funcionalidades de pesquisa em texto integral do SQL Server é que pode aproveitar a inteligência linguística contida nos "word breakers" e "stemmers" fornecidos para todas as linguagens suportadas pelo SQL Server. Ao usar os quebradores de palavras e stemmers fornecidos, pode garantir que as palavras são separadas usando os caracteres adequados a cada língua, e que sinónimos baseados em diacríticos ou variações ortográficas (como os múltiplos formatos numéricos em japonês) não são negligenciados.

Para além da inteligência linguística que regula os limites das palavras, os stemmers de cada língua podem reduzir variantes de uma palavra a um único termo, com base no conhecimento das regras de conjugação e variação ortográfica nessa língua. As regras para a análise linguística diferem para cada língua e são desenvolvidas com base em extensas pesquisas sobre corpora da vida real.

Para mais informações, consulte Configurar e Gerir Word Breakers e Stemmers para Pesquisa.

A versão de uma palavra que é armazenada após a indexação do texto completo é um token em forma comprimida. Consultas subsequentes ao índice de texto completo geram múltiplas formas flexionais de uma palavra específica com base nas regras dessa língua, para garantir que todas as correspondências prováveis sejam feitas. Por exemplo, embora o token armazenado possa ser "run", o motor de consultas também procura os termos "running", "ran" e "runner", porque são variações morfológicas regularmente derivadas da raiz "run".

Também pode criar e construir um dicionário de sinónimos para o utilizador e permitir melhores resultados de pesquisa ou categorização de termos. Ao desenvolver um dicionário de sinônimos adaptado aos seus dados de texto completo, você pode efetivamente ampliar o escopo de consultas de texto completo nesses dados. Para obter mais informações, consulte Configurar e gerir ficheiros de dicionário de sinónimos para a pesquisa Full-Text.

Os requisitos para utilizar a pesquisa em texto completo incluem o seguinte:

  • O administrador da base de dados deve criar um índice em texto completo na tabela.

  • Só é permitido um índice de texto completo por tabela.

  • Cada coluna que indexa deve ter uma chave única.

  • A indexação de texto completo é suportada apenas para colunas com estes tipos de dados: char, varchar, nchar, nvarchar, text, ntext, image, xml, varbinary e varbinary(max). Se a coluna for varbinary, varbinary(max), image ou xml, deve especificar a extensão do ficheiro do documento indexável (.doc, .pdf, .xls, e assim por diante), numa coluna de tipo separada.

Indexação Semântica

A pesquisa semântica baseia-se nas funcionalidades existentes de pesquisa em texto completo no SQL Server, mas utiliza capacidades e estatísticas adicionais para permitir cenários como a extração automática de palavras-chave e a descoberta de documentos relacionados. Por exemplo, pode usar a pesquisa semântica para construir uma taxonomia base para uma organização, ou classificar um corpus de documentos. Ou pode usar a combinação de termos extraídos e pontuações de similaridade de documentos em agrupamento ou modelos de árvore de decisão.

Depois de ativar com sucesso a pesquisa semântica e indexar as suas colunas de dados, pode usar as funções que são fornecidas nativamente com indexação semântica para fazer o seguinte:

  • Devolve frases-chave de uma palavra com a sua pontuação.

  • Devolva documentos que contenham uma frase-chave especificada.

  • Devolve as pontuações de similaridade e os termos que contribuem para a pontuação.

Para obter mais informações, consulte Localizar frases-chave em documentos com pesquisa semântica e Localizar documentos semelhantes e relacionados com a pesquisa semântica.

Para mais informações sobre os objetos da base de dados que suportam indexação semântica, veja Ativar Pesquisa Semântica em Tabelas e Colunas.

Os requisitos para usar a pesquisa semântica incluem o seguinte:

  • A pesquisa em texto completo também pode ser ativada.

  • A instalação dos componentes de pesquisa semântica também cria uma base de dados de sistema especial, que não pode ser renomeada, alterada ou substituída.

  • Os documentos que indexa através do serviço devem ser armazenados no SQL Server, em qualquer um dos objetos da base de dados suportados para indexação em texto completo, incluindo tabelas e vistas indexadas.

  • Nem todas as linguagens de texto completo suportam indexação semântica. Para uma lista de linguagens suportadas, veja sys.fulltext_semantic_languages (Transact-SQL).