Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
À medida que os agentes de IA assumem papéis críticos nos processos empresariais, a necessidade de testes confiáveis e repetíveis torna-se essencial. A avaliação de agentes permite que você gere testes que simulam cenários do mundo real para seu agente. Esses testes abordam um maior número de perguntas e conversas com mais rapidez do que os testes manuais realizados caso a caso. Em seguida, você pode medir a precisão, relevância e qualidade das respostas do seu agente, considerando as informações disponíveis para ele. Ao usar os resultados do conjunto de testes, você pode otimizar o comportamento do agente e validar que seu agente atenda aos seus requisitos de negócios e qualidade.
Por que usar testes automatizados?
A avaliação de agentes oferece testes automatizados e estruturados. Ela ajuda a identificar problemas com antecedência, reduz o risco de respostas erradas e mantém a qualidade à medida que o agente evolui. Esse processo traz uma forma automatizada e repetível de garantia de qualidade para os testes de agentes. Ele garante que o agente atenda aos padrões de precisão e confiabilidade do seu negócio e oferece transparência sobre seu desempenho. Ele tem pontos fortes diferentes do teste ao usar o chat de teste.
Você executa avaliações e vê os resultados usando a interface do Copilot Studio, por meio das APIs REST do Power Platform ou adicionando ações em ferramentas, fluxos ou no Power Automate.
A avaliação do agente mede correção e o desempenho, não a ética ou problemas de segurança da IA. Um agente pode passar em todos os testes de avaliação, mas ainda assim, por exemplo, produzir uma resposta inadequada a uma pergunta. Os clientes devem continuar usando revisões de IA responsável e filtros de segurança de conteúdo. As avaliações não substituem essas revisões e filtros.
Limitações da Nuvem da Comunidade Governamental
A avaliação de agentes na GCC (Nuvem da Comunidade Governamental) apresenta as seguintes limitações:
Os criadores não podem adicionar um perfil de usuário aos seus conjuntos de teste. No entanto, os criadores ainda podem realizar avaliações sem um perfil de usuário.
Os criadores não podem usar o método de teste de semelhança para avaliações. Todos os outros métodos de teste estão disponíveis.
Como funciona a avaliação de agentes
O Copilot Studio usa um caso de teste para cada avaliação de agente. Um caso de teste é uma única interação que simula como um usuário interagiria com seu agente. A interação pode ser uma única pergunta ou uma conversa inteira.
Um caso de teste também pode incluir a resposta que você espera que seu agente responda. Por exemplo:
A pergunta: Qual é o seu horário de expediente?
A resposta esperada: Estamos abertos das 9h às 17h de segunda a sexta-feira.
Usando a avaliação de agentes, você pode gerar, importar ou gravar manualmente um grupo de casos de teste. Esse grupo de casos de teste é chamado de conjunto de teste. Um conjunto de teste permite que você:
Execute vários casos de teste que abranjam uma ampla variedade de recursos ao mesmo tempo, em vez de fazer uma pergunta de cada vez ao seu agente.
Analise o desempenho do seu agente com uma pontuação agregada fácil de digerir e também examine em detalhes casos de teste individuais.
Teste alterações em seus agentes usando o mesmo conjunto de teste, assim você terá um padrão objetivo para medir e comparar alterações no desempenho.
Crie rapidamente novos conjuntos de teste ou modifique os existentes para cobrir as mudanças nos recursos ou requisitos do agente.
Cada conjunto de teste pode avaliar seu agente usando vários métodos de teste ao mesmo tempo.
Você também pode escolher um perfil de usuário para atuar como o usuário estimulado. O agente pode ser configurado para responder a diferentes usuários de formas diferentes ou permitir o acesso aos recursos de maneiras distintas.
Quando você seleciona um conjunto de testes e executa uma avaliação do agente, o Copilot Studio envia as perguntas dos casos de teste, registra as respostas do agente, compara essas respostas com as respostas esperadas ou com um padrão de qualidade e atribui uma pontuação a cada caso de teste. Você também pode ver os detalhes, a transcrição e o mapa de atividades de cada caso de teste, além de quais recursos seu agente usou para criar a resposta.
Criar uma estratégia de avaliação abrangente
Antes de executar avaliações, defina o que caracteriza o sucesso para seu agente e decida quais cenários são mais importantes para os resultados do seu negócio. Uma estratégia clara ajuda você a escolher os métodos de teste certos, priorizar casos de teste de alto impacto e interpretar os resultados com o contexto correto.
Use Arquitetura de soluções de agentes: estruturas de avaliação para mapear objetivos de negócio para dimensões de avaliação mensuráveis e estratégias de pontuação.
Use Desenhar e operacionalizar a avaliação do agente para criar um processo de avaliação repetitivo que suporte melhorias contínuas de qualidade.
Integrar avaliações em fluxos automatizados
A avaliação de agentes permite a automação para que os criadores possam executar avaliações sem intervenção manual. Ao usar APIs REST ou conectores do Power Platform, você pode desencadear execuções de avaliação de forma programática e integrar testes em fluxos de trabalho automatizados, como pipelines de CI/CD (integração contínua e implantação contínua). Essa abordagem permite executar conjuntos de teste em grande escala e validar o comportamento do agente conforme as mudanças são introduzidas, sem exigir execução manual no Copilot Studio.
Chat de teste versus avaliação de agente
Cada método de teste oferece diferentes insights sobre as qualidades e o comportamento do seu agente:
Recebe e responde a uma pergunta de cada vez. É difícil repetir os mesmos testes várias vezes.
Permite testar uma sessão completa contendo várias mensagens.
Permite que você interaja com seu agente como usuário usando uma interface de chat.
Avaliação do agente:
Pode criar e executar vários casos de teste ao mesmo tempo usando um conjunto de testes. Você pode repetir os testes usando o mesmo conjunto de testes.
Pode testar uma pergunta e uma resposta por caso de teste, ou uma conversa por caso de teste. No entanto, você tem menos controle sobre as conversas do que teria usando o chat de teste.
Escolha perfis de usuário diferentes para simular usuários distintos, sem precisar realizar as interações pessoalmente.
Quando testar um agente, use tanto o chat de teste quanto a avaliação de agente para obter uma visão abrangente do seu agente.
Suporte a idiomas na avaliação de agentes
Os agentes do Copilot Studio oferecem suporte a vários idiomas. Se configurar seu agente para oferecer suporte a mais de um idioma, você poderá selecionar o idioma desejado para cada avaliação.
Para um agente multilíngue, os seguintes componentes de avaliação apresentam comportamentos específicos:
Geração de consultas
O idioma padrão é o idioma que você usa principalmente ao inserir entradas de avaliação. Selecione o idioma para executar a avaliação. Quando você executa mais avaliações, a saída estará no mesmo idioma da entrada.
Execução do avaliador
Ao avaliar um agente multilíngue, o método de avaliação de comparação de significado compara a resposta esperada com a resposta do agente. Se surgir um problema relacionado a vários idiomas, o sistema detecta a inconsistência, o avaliador de comparação de significado reprova a resposta e a resposta é marcada como reprovada devido à inconsistência de idiomas.
Saída de explicabilidade
Em conversas com várias rodadas com um agente multilíngue, o agente fornece raciocínio no mesmo idioma que ele usa em suas respostas.
Limitações
No momento, a avaliação de agentes não oferece suporte a agentes de dados do Fabric.
Informações relacionadas
- Planejar e criar um teste de desempenho de agente de conversa
- Projetar e operacionalizar a avaliação de agentes
- Aprimorar agentes usando triagem e correção baseadas em avaliação
- Arquitetura de soluções de agentes: estruturas de avaliação
- Arquitetura de soluções de agentes: abordagens comuns de avaliação