Entender os embeddings no Azure OpenAI em Microsoft Foundry Models (clássico)

Aplica-se somente a:Portal do Foundry (clássico). Este artigo não está disponível para o novo portal do Foundry. Saiba mais sobre o novo portal.

Nota

Links neste artigo podem abrir conteúdo na nova documentação do Microsoft Foundry em vez da documentação da Foundry (clássica) que você está exibindo agora.

Uma inserção é um formato especial de representação de dados que os algoritmos e modelos de machine learning podem usar facilmente. A inserção é uma representação densa de informações do significado semântico de um texto. Cada inserção é um vetor de números de ponto flutuante, de modo que a distância entre duas inserções no espaço vetor esteja correlacionada com a semelhança semântica entre duas entradas no formato original. Por exemplo, se dois textos forem semelhantes, suas representações de vetor também deverão ser semelhantes. Embeddings impulsionam a busca por similaridade vetorial em sistemas de recuperação, como o Pesquisa de IA do Azure  (recomendado), e em bancos de dados do Azure, como Azure Cosmos DB for MongoDB vCore, Banco de Dados SQL do Azure e Banco de Dados do Azure para PostgreSQL - Flexible Server.

Inserindo modelos

As inserções facilitam o aprendizado de máquina em entradas grandes que representam palavras capturando as semelhanças semânticas em um espaço de vetor. Portanto, você pode usar inserções para determinar se duas partes de texto estão relacionadas semanticamente ou semelhantes e fornecer uma pontuação para avaliar a similaridade.

Similaridade cosseno

As incorporações do OpenAI do Azure frequentemente dependem da similaridade do cosseno para calcular a similaridade entre documentos e uma consulta.

Do ponto de vista matemático, a similaridade de cosseno mede o cosseno do ângulo entre dois vetores projetados em um espaço multidimensional. Essa medida é benéfica, pois se dois documentos estiverem distantes pela distância euclidiana devido ao tamanho, ainda poderiam ter um ângulo menor entre eles e, portanto, uma semelhança de cosseno maior. Para obter mais informações sobre equações de similaridade de cosseno, consulte a similaridade cossina.

Um método alternativo de identificação de documentos semelhantes é contar o número de palavras comuns entre documentos. Essa abordagem não é escalável, pois uma expansão no tamanho do documento provavelmente resultará em um maior número de palavras comuns detectadas mesmo em diferentes tópicos. Por esse motivo, a similaridade cossina pode oferecer uma alternativa mais eficaz.

Próximas etapas