Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
A medida que los agentes de IA asumen roles críticos en los procesos empresariales, la necesidad de pruebas fiables y repetibles se vuelve esencial. La evaluación de agentes le permite generar pruebas que simulan escenarios reales para su agente. Estas pruebas cubren más preguntas y conversaciones más rápido que las pruebas manuales caso por caso. Después, puede medir la precisión, relevancia y calidad de las respuestas de las interacciones de su agente, basándose en la información a la que pueda tener acceso. Con los resultados del conjunto de pruebas, puede optimizar el comportamiento del agente y validar que el agente cumple los requisitos empresariales y de calidad.
¿Por qué usar las pruebas automatizadas?
La evaluación de agentes proporciona pruebas automatizadas y estructuradas. Ayuda a detectar problemas a tiempo, reduce el riesgo de respuestas incorrectas y mantiene la calidad a medida que el agente evoluciona. Este proceso aporta una forma automatizada y repetible de aseguramiento de la calidad a las pruebas de agentes. Garantiza que el agente cumpla con los estándares de precisión y fiabilidad de su empresa y ofrece transparencia sobre su rendimiento. Tiene ventajas diferentes a las pruebas usando el chat de prueba.
Puede realizar evaluaciones y consultar los resultados mediante la interfaz de Copilot Studio, a través de API REST de Power Platform, o mediante agregando acciones en herramientas, flujos o Power Automate.
La evaluación de agentes mide la exactitud y el rendimiento, no la ética de la IA ni los problemas de seguridad. Un agente puede superar todas las pruebas de evaluación y aun así, por ejemplo, generar una respuesta inapropiada a una pregunta. Los clientes deben seguir utilizando revisiones responsables de IA y filtros de seguridad de contenido; las evaluaciones no reemplazan esas revisiones y filtros.
Limitaciones de la nube de la comunidad gubernamental
La evaluación de agentes en Government Community Cloud (GCC) presenta las siguientes limitaciones:
Los creadores no pueden agregar un perfil de usuario a sus conjuntos de prueba. Sin embargo, los creadores aún pueden realizar evaluaciones sin un perfil de usuario.
Los creadores no pueden usar el método de la prueba de similitud para evaluaciones. Todos los demás métodos de prueba están disponibles.
Cómo funciona la evaluación de los agentes
Copilot Studio utiliza un caso de prueba para cada evaluación de agente. Un caso de prueba es una interacción única que simula cómo un usuario interactuaría con su agente. La interacción puede ser una sola pregunta o toda una conversación.
Un caso de prueba también puede incluir la respuesta que espera que su agente proporcione. Por ejemplo:
La pregunta: ¿Cuáles son sus horarios de atención?
La respuesta esperada: Nuestro horario es de 9 a.m. a 5 p.m. de lunes a viernes.
Mediante la evaluación de agentes, puede generar, importar o escribir manualmente un grupo de casos de prueba. Este grupo de casos de prueba se denomina un conjunto de pruebas. Un conjunto de pruebas le permite:
Ejecutar múltiples casos de prueba que cubren una amplia gama de capacidades al mismo tiempo, en lugar de preguntarle a su agente una pregunta cada vez.
Analizar el rendimiento de su agente con una puntuación agregada fácil de comprender y revisar en detalle los casos de prueba individuales.
Pruebe los cambios introducidos en sus agentes utilizando el mismo conjunto de pruebas, de modo que disponga de un criterio objetivo para medir y comparar las variaciones en el rendimiento.
Cree rápidamente nuevos conjuntos de pruebas o modifique los existentes para cubrir las capacidades o requisitos cambiantes del agente.
Cada conjunto de pruebas puede evaluar a su agente utilizando múltiples métodos de prueba a la vez.
También puede elegir un perfil de usuario para que actúe como usuario estimulado. El agente puede estar configurado para responder a diferentes usuarios de distintas maneras, o permitir el acceso a recursos de diferentes formas.
Cuando selecciona un conjunto de pruebas y ejecuta una evaluación del agente, Copilot Studio envía las preguntas de los casos de prueba, registre las respuestas del agente, compare esas respuestas con las esperadas o con un estándar de calidad, y asigne una puntuación a cada caso de prueba. También puede ver los detalles, la transcripción y el mapa de actividad de cada caso de prueba, así como los recursos que su agente utilizó para crear la respuesta.
Crear una estrategia de evaluación integral
Antes de realizar evaluaciones, defina qué significa el éxito para su agente y decida qué escenarios son los que más importan para los resultados de su negocio. Una estrategia clara le ayuda a elegir los métodos de prueba adecuados, priorizar casos de alto impacto e interpretar los resultados con el contexto adecuado.
Utiliza Arquitectura de soluciones de agente: marcos de evaluación para asignar objetivos empresariales a dimensiones de evaluación medibles y enfoques de puntuación.
Utilice Diseño y operacionalización de la evaluación de agentes para construir un proceso de evaluación repetible que apoye mejoras continuas en la calidad.
Integrar evaluaciones en flujos automatizados
La evaluación de agentes admite la automatización para que los creadores puedan ejecutar evaluaciones sin intervención manual. Al utilizar API REST o conectores de Power Platform, puede activar programáticamente ejecuciones de evaluación e integrar pruebas en flujos de trabajo automatizados, como la integración continua y la implementación continua (CI/CD). Este enfoque le permite ejecutar conjuntos de pruebas de forma escalable y validar el comportamiento de los agentes a medida que se introducen cambios, sin necesidad de ejecución manual en Copilot Studio.
Chat de prueba frente a evaluación de agentes
Cada método de prueba le ofrece diferentes perspectivas sobre las cualidades y el comportamiento de su agente:
Reciba y responda a una pregunta cada vez. Es difícil repetir las mismas pruebas varias veces.
Permite probar una sesión completa que contiene varios mensajes.
Permite interactuar con su agente como usuario mediante una interfaz de chat.
Evaluación del agente:
Puede crear y ejecutar múltiples casos de prueba a la vez utilizando un conjunto de pruebas. Puede volver a ejecutar las pruebas utilizando el mismo conjunto de pruebas.
Puede probar una pregunta y una respuesta por caso de prueba, o una conversación por caso de prueba. Sin embargo, tiene menos control sobre las conversaciones que al usar el chat de prueba.
Seleccione diferentes perfiles de usuario para simular distintos usuarios sin necesidad de realizar las interacciones usted mismo.
Cuando pruebe un agente, utilice tanto el chat de prueba como la evaluación del agente para obtener una visión completa de su agente.
Soporte de idiomas en la evaluación de agentes
Los agentes de Copilot Studio admiten múltiples idiomas. Si configura su agente para soportar más de un idioma, puede seleccionar el idioma que desee para una evaluación determinada.
Para un agente multilingüe, los siguientes componentes de evaluación tienen comportamientos específicos:
Generación de consultas
El idioma predeterminado es el que usa principalmente al introducir entradas de evaluación. Seleccione el idioma en el que desea ejecutar la evaluación. Cuando realiza más evaluaciones, la salida se genera en el mismo idioma que la entrada.
Ejecución del evaluador
Cuando evalúa un agente multilingüe, el método de evaluación comprar significado compara la respuesta esperada con la respuesta del agente. Si surge un problema relacionado con varios idiomas, el sistema detecta la discrepancia, el evaluador comparar significado marca la respuesta como fallida y la respuesta se marca como fallida debido a la inconsistencia lingüística.
Salida de capacidad de explicación
En conversaciones de varios turnos con un agente multilingüe, el agente proporciona razonamiento en el mismo idioma que utiliza en sus respuestas.
Limitaciones
Actualmente, la evaluación de agentes no soporta Agentes de datos de Fabric.
Información relacionada
- Planificar y crear una prueba de rendimiento del agente conversacional
- Diseñar y operacionalizar la evaluación de agentes
- Mejorar agentes mediante la corrección y el triaje basado en evaluación
- Arquitectura de soluciones de agentes: Marcos de evaluación
- Arquitectura de soluciones de agentes: enfoques comunes de evaluación