Ricerca semantica (SQL Server)

Si applica a:SQL Server

La ricerca semantica statistica estrae e indicizza frasi chiave statisticamente rilevanti da documenti non strutturati memorizzati in database SQL Server. Successivamente utilizza queste frasi chiave per identificare documenti simili o correlati.

Overview

La ricerca semantica estende la ricerca in testo completo abbinando il significato del documento piuttosto che con parole esatte. I casi d'uso comuni includono l'estrazione automatica dei tag, la scoperta di contenuti correlati e la navigazione gerarchica tra contenuti simili. Ad esempio, puoi consultare l'indice delle parole chiave per costruire una tassonomia per un corpus documentale, oppure consultare l'indice di somiglianza del documento per identificare i curriculum che corrispondono a una descrizione del lavoro.

I seguenti esempi mostrano le tre funzioni Transact-SQL di righe che si usano per interrogare gli indici semantici e recuperare i risultati come dati strutturati.

Individuare le frasi chiave in un documento

Nella query seguente vengono ottenute le frasi chiave identificate nel documento di esempio. Presenta i risultati in ordine decrescente in base al punteggio di classificazione della rilevanza statistica di ogni frase chiave.

Questa query chiama la funzione semantickeyphrasetable.

SET @Title = 'Sample Document.docx';

SELECT @DocID = DocumentID
FROM Documents
WHERE DocumentTitle = @Title;

SELECT @Title AS Title,
       keyphrase,
       score
FROM SEMANTICKEYPHRASETABLE (Documents, *, @DocID)
ORDER BY score DESC;

Nella query seguente vengono ottenuti i documenti identificati come simili o correlati al documento di esempio. Presenta i risultati in ordine decrescente in base al punteggio di classificazione della somiglianza dei due documenti.

Questa query chiama la funzione semanticsimilaritytable.

SET @Title = 'Sample Document.docx';

SELECT @DocID = DocumentID
FROM Documents
WHERE DocumentTitle = @Title;

SELECT @Title AS SourceTitle,
       DocumentTitle AS MatchedTitle,
       DocumentID,
       score
FROM SEMANTICSIMILARITYTABLE (Documents, *, @DocID)
     INNER JOIN Documents
         ON DocumentID = matched_document_key
ORDER BY score DESC;

Nella query seguente vengono ottenute le frasi chiavi indicanti la somiglianza o la correlazione tra i due documenti di esempio. Presenta i risultati in ordine decrescente in base al punteggio di classificazione del peso di ogni frase chiave.

Questa query chiama la funzione semanticsimilaritydetailstable.

SET @SourceTitle = 'first.docx';
SET @MatchedTitle = 'second.docx';

SELECT @SourceDocID = DocumentID
FROM Documents
WHERE DocumentTitle = @SourceTitle;

SELECT @MatchedDocID = DocumentID
FROM Documents
WHERE DocumentTitle = @MatchedTitle;

SELECT @SourceTitle AS SourceTitle,
       @MatchedTitle AS MatchedTitle,
       keyphrase,
       score
FROM SEMANTICSIMILARITYDETAILSTABLE (
    Documents, DocumentContent, @SourceDocID, DocumentContent, @MatchedDocID
)
ORDER BY score DESC;

Archiviare i documenti in SQL Server

Prima di poter indicizzare i documenti con la ricerca semantica, memorizza i documenti nel motore di database.

La funzione FileTable in SQL Server memorizza file e documenti non strutturati nel database, così puoi manipolarli insieme ai dati strutturati in Transact-SQL operazioni basate su insiemi.

Per maggiori informazioni sulla funzione FileTable, vedi FileTables. Per informazioni sulla funzione FILESTREAM, che è un'altra opzione per memorizzare documenti nel database, vedi FILESTREAM.

Articolo Description
Installare e configurare la ricerca semantica Vengono descritti i prerequisiti per la ricerca semantica statistica e viene indicato come installarli o verificarli.
Abilita la ricerca semantica su tabelle e colonne Viene descritto come abilitare o disabilitare l'indicizzazione semantica statistica in colonne selezionate contenenti documenti o testo.
Trovare frasi chiave nei documenti tramite la ricerca semantica Viene descritto come individuare le frasi chiave nei documenti o nelle colonne di testo configurati per l'indicizzazione semantica statistica.
Trova documenti simili e correlati con ricerca semantica Viene descritto come reperire documenti o valori di testo simili o correlati, nonché informazioni relative alla somiglianza o correlazione, in colonne configurate per l'indicizzazione semantica statistica.
Gestire e monitorare la ricerca semantica Vengono descritti il processo di indicizzazione semantica e le attività correlate al monitoraggio e alla gestione degli indici.