Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Aplica-se a: SQL Server
SSIS Integration Runtime em Azure Data Factory
Para adicionar e configurar uma transformação Fuzzy Grouping, o pacote deve já incluir pelo menos uma tarefa Fluxo de Dados e uma fonte.
Para implementar a transformação de Agrupamento Fuzzy num fluxo de dados
No SSDT (SQL Server Data Tools), abra o projeto Integration Services que contém o pacote desejado.
No Gerenciador de Soluções, clique duas vezes no pacote para abri-lo.
Clique no separador Fluxo de Dados e, a partir da Toolbox, arraste a transformação Fuzzy Grouping para a superfície de design.
Ligue a transformação de Agrupamento Difuso ao fluxo de dados arrastando o conector da origem de dados ou de uma transformação anterior para a transformação de Agrupamento Difuso.
Clique duas vezes na transformação de Agrupamento Fuzzy.
Na caixa de diálogo Fuzzy Grouping Transformation Editor, no separador Gestor de Ligações, selecione um OLE DB connection manager que se ligue a uma base de dados SQL Server.
Note
A transformação requer uma ligação a uma base de dados SQL Server para criar tabelas e índices temporários.
Selecione o separador Colunas e, na lista Colunas de Entrada Disponíveis, selecione a caixa de verificação das colunas de entrada a utilizar para identificar linhas semelhantes no conjunto de dados.
Selecione as caixas de verificação na coluna Pass Through para indicar as colunas de entrada a incluir na saída da transformação. As colunas pass-through não são incluídas no processo de identificação de linhas duplicadas.
Note
As colunas de entrada usadas para agrupamento são automaticamente selecionadas como colunas de passagem, e não podem ser desselecionadas enquanto usadas para agrupamento.
Opcionalmente, atualize os nomes das colunas de saída na coluna Alias de Saída .
Opcionalmente, atualize os nomes das colunas limpas na coluna Group OutputAlias .
Note
Os nomes padrão das colunas são os nomes das colunas de entrada com o sufixo "_clean".
Opcionalmente, atualize o tipo de correspondência a usar na coluna Tipo de Correspondência .
Note
Pelo menos uma coluna deve usar correspondência fuzzy.
Especifique as colunas do nível mínimo de similaridade na coluna de Similaridade Mínima . O valor deve estar entre 0 e 1. Quanto mais próximo estiver o valor de 1, mais semelhantes devem ser os valores nas colunas de entrada para formar um grupo. Uma semelhança mínima de 1 indica uma correspondência exata.
Opcionalmente, atualize os nomes das colunas de similaridade na coluna Alias de Saída de Similaridade .
Para especificar o tratamento dos números nos valores dos dados, atualize os valores na coluna Numerais .
Para especificar como a transformação compara os dados das cadeias numa coluna, modifique a seleção padrão das opções de comparação na coluna Indicadores de Comparação .
Clique no separador Avançado para modificar os nomes das colunas que a transformação adiciona à saída do identificador de linha único (_key_in), do identificador de linha duplicado (_key_out) e do valor de similaridade (_score).
Opcionalmente, ajusta o limiar de similaridade movendo a barra deslizante.
Opcionalmente, desmarque as caixas de seleção dos delimitadores de tokens para ignorar os delimitadores presentes nos dados.
Clique em OK.
Para guardar o pacote atualizado, clique em Guardar itens selecionados no menu Ficheiro.