Descripción de las inserciones en Azure OpenAI en los modelos de Microsoft Foundry (clásico)

Solo se aplica a:Portal de Foundry (clásico). Este artículo no está disponible para el nuevo portal de Foundry. Obtenga más información sobre el nuevo portal.

Nota

Los vínculos de este artículo pueden abrir contenido en la nueva documentación de Microsoft Foundry en lugar de la documentación de Foundry (clásico) que está viendo ahora.

Una inserción es un formato especial de representación de datos que los modelos y algoritmos de aprendizaje automático pueden usar fácilmente. La inserción es una representación densa de información del significado semántico de un fragmento de texto. Cada inserción es un vector de números de punto flotante, de modo que la distancia entre dos incrustaciones en el espacio vectorial se correlaciona con la similitud semántica entre dos entradas en el formato original. Por ejemplo, si dos textos son similares, sus representaciones vectoriales también deben ser similares. Inserta la búsqueda de similitud de vectores de energía en sistemas de recuperación como Búsqueda de Azure AI (recomendado) y en bases de datos de Azure, como Azure Cosmos DB para núcleo virtual de MongoDB, Azure SQL Database y Azure Database for PostgreSQL - Servidor flexible.

Inserción de modelos

Las incrustaciones facilitan el aprendizaje automático en entradas grandes que representan palabras mediante la captura de las similitudes semánticas en un espacio vectorial. Por lo tanto, puede usar incrustaciones para determinar si dos fragmentos de texto están relacionados semánticamente o similares y proporcionar una puntuación para evaluar la similitud.

Similitud coseno

Las inserciones de Azure OpenAI suelen depender de la similitud de coseno con respecto a la similitud de proceso entre documentos y una consulta.

Desde una perspectiva matemática, la similitud coseno mide el coseno del ángulo entre dos vectores proyectados en un espacio multidimensional. Esta medición es beneficiosa, porque si dos documentos están muy separados por distancia euclidiana debido al tamaño, podrían tener un ángulo más pequeño entre ellos y, por lo tanto, una similitud de coseno más alta. Para obtener más información sobre las ecuaciones de similitud de coseno, consulte Similitud de coseno.

Un método alternativo para identificar documentos similares es contar el número de palabras comunes entre documentos. Este enfoque no se escala, ya que es probable que una expansión en el tamaño del documento lleve a un mayor número de palabras comunes detectadas incluso entre temas dispares. Por este motivo, la similitud coseno puede ofrecer una alternativa más eficaz.

Pasos siguientes