Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
Itens marcados (versão prévia) neste artigo estão atualmente em versão prévia pública. Essa versão prévia é fornecida sem um contrato de nível de serviço e não recomendamos isso para cargas de trabalho de produção. Alguns recursos podem não ter suporte ou ter recursos restritos. Para obter mais informações, consulte Supplemental Terms of Use for Microsoft Azure Previews.
Teste seus modelos e agentes de IA generativos executando avaliações que medem o desempenho, a qualidade e a segurança. Use avaliações antes da implantação para validar o comportamento ou após a implantação para monitorar a qualidade da produção. As avaliações executam seu modelo ou agente em relação aos dados de teste e pontuam as saídas usando avaliadores internos ou personalizados.
Este artigo mostra como criar e executar avaliações no portal do Foundry.
Pré-requisitos
Uma assinatura do Azure. Criar um gratuitamente.
Um projeto do Microsoft Foundry. Crie um projeto se você não tiver um.
Um dos itens a seguir, dependendo do alvo da avaliação:
- Avaliação do agente: Um agente em seu projeto.
- Avaliação do modelo: um modelo implantado ou um modelo disponível com acesso instantâneo.
- Avaliação do conjunto de dados: um conjunto de dados de teste no formato CSV ou JSONL que contém saídas de modelo ou agente preexistente.
Uma conexão do Azure OpenAI com um modelo GPT implantado (por exemplo,
gpt-4.1-mini). Necessário para avaliações de qualidade assistidas por IA.função de usuário do Foundry no projeto Foundry. Para obter mais informações, consulte o controle de acesso baseado em funções para o Microsoft Foundry.
Importante
As funções RBAC do Foundry foram renomeadas recentemente. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager eram anteriormente chamados de Usuário do Azure AI, Proprietário do Azure AI, Proprietário da conta do Azure AI e Gerente de Projeto do Azure AI. Você ainda pode ver os nomes anteriores em alguns lugares enquanto essa mudança de nome está sendo implementada. Os IDs das funções e as permissões principais não são alterados com a mudança de nome.
Escolher uma abordagem de avaliação
Selecione uma abordagem de avaliação com base no que você deseja testar:
| Meta | Scope | Fonte de dados | Mais adequado para |
|---|---|---|---|
| Agente | Conversas completas | Dados simulados | Testando o comportamento do agente de ponta a ponta com cenários sintéticos antes da implantação. |
| Agente | Conversas completas | Conversas existentes | Avaliando interações reais do usuário para monitorar a qualidade da produção. |
| Agente | Turnos individuais | Conjunto de dados existente | Depuração de respostas específicas do agente, teste do uso de ferramentas, análise detalhada. |
| Agente | Turnos individuais | Dados sintéticos | Testando cenários de Perguntas & respostas ou RAG de rodada única com consultas geradas. |
| Agente | Turnos individuais | Rastros existentes | Avaliar rastreamentos históricos de agentes do seu projeto. |
| Modelo | Turnos individuais | Dados sintéticos | Testar complementações do modelo com prompts gerados. |
| Modelo | Turnos individuais | Conjunto de dados existente | Avaliação do desempenho do modelo em relação a um conjunto de testes selecionado. |
| Conjunto de dados | Turnos individuais | (O conjunto de dados é o alvo) | Avaliando saídas preexistenciantes sem executar novamente o modelo ou o agente. |
Dica
Comece com conversas > completas do agente > dados simulados para testar o comportamento do agente em cenários controlados. Use Conversas existentes quando seu agente estiver em produção para monitorar o desempenho em condições reais.
Criar uma avaliação
Você pode iniciar uma avaliação de vários locais no portal do Foundry:
- Página de avaliação: no painel esquerdo, selecione Criar Avaliação>.
- Página Modelos: vá para o modelo, selecione a guia Avaliação e, em seguida, selecione Criar.
- Página Agentes: vá para o agente, selecione a guia Avaliação e, em seguida, selecione Criar.
- Acesso ao playground do seu agente: acesse seu agente, selecione a guia Playground e selecione Métricas>Executar uma avaliação completa.
Etapa 1: Selecionar destino de avaliação
Ao criar uma avaliação, escolha primeiro o destino de avaliação. O alvo determina o que será comparado à avaliação:
| Meta | Description |
|---|---|
| Agente | Avalia a saída gerada pelo agente selecionado e a entrada definida pelo usuário. Funciona para agentes de prompt e agentes hospedados. |
| Modelo | Avalia a saída gerada pelo modelo selecionado e pelo prompt definido pelo usuário. |
| Conjunto de dados | Avalia as saídas preexistentes de um modelo ou agente em um conjunto de dados de teste. |
| Traces | Avalia as interações do agente já capturadas no Application Insights. Selecione o agente e o intervalo de tempo e o portal recupera os rastreamentos correspondentes para avaliação. Para obter o equivalente do SDK, consulte Avaliação de traços. |
Dica
Acesso instantâneo: o acesso instantâneo são modelos sem implantação que você pode usar imediatamente sem criar uma implantação. Ao criar uma avaliação, você pode selecionar um modelo instantâneo como o destino de avaliação ou o modelo de juiz diretamente do seletor de modelo.
Etapa 2: Selecionar escopo de avaliação
Nota
Esta etapa é exibida somente para os alvos Agent e Dataset. As avaliações de modelo sempre usam turnos individuais.
Escolha como você deseja avaliar o desempenho do agente:
| Scope | Description | Mais adequado para |
|---|---|---|
| Conversas completas (versão prévia) | Avalia conversas completas de vários turnos do início ao fim. Mede a qualidade geral da conversa, a conclusão da tarefa e a satisfação do usuário. | Testando experiências de agente de ponta a ponta, satisfação do cliente e fluxo de conversa. |
| Turnos individuais | Avalia as respostas individuais do agente em conversas. Mede métricas por turno, como precisão na seleção de ferramentas e qualidade da resposta. | Depuração de comportamentos específicos do agente, teste do uso de ferramentas e análise detalhada. |
Etapa 3: Selecionar fonte de dados
As opções da fonte de dados dependem do seu destino e escopo de avaliação.
Para avaliações de conversa (conversas completas do agente >) (versão prévia)
Escolha de onde vêm os dados da conversa:
Dados simulados
Gere conversas sintéticas executando seu agente com descrições de cenários de um conjunto de dados. Use essa opção para testar o comportamento do agente em cenários controlados antes da implantação.
Selecione dados simulados.
Selecione Gerar para abrir a caixa de diálogo de configuração de simulação.
Selecione seu arquivo: escolha um conjunto de dados que contém descrições de cenário. Cada linha em seu conjunto de dados descreve um cenário que você usa para gerar uma conversa simulada.
Selecione o modelo: escolha o modelo que simula o usuário na conversa:
-
gpt-4.1(recomendado para cenários complexos) gpt-4ogpt-4o-minigpt-4.1-mini
-
Definir configurações de simulação:
- Número de conversas simuladas por cenário: quantas conversas gerar para cada linha em seu conjunto de dados (1 a 5). Várias conversas por cenário ajudam a identificar a variação no comportamento do agente.
- Número de turnos por conversa: máximo de turnos permitido por conversa (1 a 50). A conversa termina quando a tarefa é concluída ou esse limite é atingido.
Selecione Confirmar para salvar sua configuração de simulação.
Conversas existentes
Avalie conversas reais que seu agente já teve com os usuários.
- Selecione conversas existentes.
- Configurar opções de filtragem:
- Número de conversas: número máximo de conversas a serem amostradas do intervalo de datas (1 a 100).
- Intervalo de tempo: filtrar conversas por período de tempo. Use filtros rápidos (Último Dia, 7D, 1M, 3M) ou selecione um intervalo de datas personalizado.
- Navegue e selecione conversas específicas para incluir na avaliação.
Para avaliações de turnos individuais
Escolha de onde vêm os dados de avaliação:
Dados sintéticos
Gere consultas de teste usando IA. Selecione Sintético e configure o número de linhas e um prompt que descreve os dados a serem gerados. Você também pode carregar arquivos para melhorar a relevância.
Nota
A geração de dados sintéticos requer um modelo com funcionalidade de API de Respostas. Para obter disponibilidade, consulte a disponibilidade da região da API de Respostas.
Conjunto de dados existente
Use um conjunto de dados preparado no formato CSV ou JSONL. Selecione o conjunto de dados existente e escolha um arquivo dos ativos de dados do projeto. Há suporte apenas para formatos de arquivo CSV e JSONL.
Rastreamentos já existentes (apenas do agente)
Avalie os registros históricos de agentes do seu projeto. Selecione Rastreamentos existentes e filtre por intervalo de datas para selecionar rastreamentos.
Conteúdo multimodal (versão prévia)
Todos os destinos de avaliação dão suporte a conteúdo de imagem e áudio. Cada tipo de conteúdo usa um esquema JSONL específico:
Conteúdo da imagem:
-
image_url: a imagem como um URI de dados (por exemplo,data:image/png;base64,...) ou uma URL acessível publicamente. -
caption: uma descrição de texto do conteúdo da imagem.
{"image_url": "data:image/png;base64,iVBOR...", "caption": "A red to blue color gradient"}
Conteúdo de áudio:
-
audio_data: o áudio como um URI de dados com dados WAV codificados em base64 (por exemplo,data:audio/wav;base64,...). -
expected: uma descrição de texto do conteúdo de áudio esperado.
Nota
Atualmente, há suporte apenas para o formato de áudio WAV.
{"audio_data": "data:audio/wav;base64,UklGR...", "expected": "A short beep tone at 440 Hz"}
Os conjuntos de dados também podem usar o formato de conversa de mensagem de chat, em que os dados de áudio e imagem são inseridos em uma única coluna de mensagem de chat como URIs de dados ou URLs publicamente acessíveis.
O exemplo a seguir mostra uma coluna de conjunto de dados de conversa com conteúdo de áudio e imagem inserido:
[
{
"role": "system",
"content": "..."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "What are in these images?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/path/image.png"
}
},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64,iVBORw0KGgo..."
}
}
]
},
{
"role": "assistant",
"content": "..."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "Tell me the tones for the voices?"
},
{
"type": "input_audio",
"input_audio": {
"data": "https://example.com/path/voice.wav",
"format": "wav"
}
},
{
"type": "input_audio",
"input_audio": {
"data": "data:audio/wav;base64,UklGRigAAA...",
"format": "wav"
}
}
]
}
]
Você pode visualizar imagens e reproduzir clipes de áudio diretamente no fluxo de criação de avaliação e na exibição de resultados da avaliação.
Etapa 4: Configurar agentes
Nota
Esta etapa é exibida somente para avaliações do Agente.
Personalize como seu agente se comporta durante a avaliação:
- Examine a lista de agentes envolvidos na avaliação.
- Para cada agente, selecione Configurar para personalizar seu comportamento:
- Prompt do sistema: Modifique as instruções do agente para a avaliação.
- Prompt do usuário: especifique como cada item de conjunto de dados é enviado ao seu agente durante a avaliação.
- A execução de avaliação preserva as configurações do agente.
Configuração de prompt do usuário
O prompt do usuário define como as entradas de teste são passadas para o agente. Por padrão, o portal usa {{item.query}} para passar a consulta do conjunto de dados diretamente para o agente.
Na maioria dos casos, você pode usar o padrão. Somente altere esse valor se o agente espera um formato de entrada diferente. Por exemplo, se o agente usa um protocolo de agente hospedado ou requer entrada estruturada com campos adicionais.
Padrões comuns:
| Formato | Quando usar |
|---|---|
{{item.query}} |
Padrão. Passa o campo de consulta diretamente do conjunto de dados. |
{{item.messages}} |
Para agentes que esperam o histórico de conversas como entrada. |
| JSON personalizado | Para agentes hospedados ou APIs que exigem corpos de solicitação estruturados. |
Dica
Use prompts personalizados para testar casos extremos ou cenários específicos que talvez não ocorram naturalmente no seu conjunto de dados.
Etapa 5: Configurar o mapeamento de campo
Nota
Esta etapa é exibida quando você usa dados existentes (conversas existentes, conjunto de dados existentes ou rastreamentos existentes).
Mapeie seus campos de dados para os campos que cada avaliador espera. Os campos necessários dependem do escopo de avaliação.
Para avaliações de conversa (com várias rodadas)
| Campo | Description | Obrigatório |
|---|---|---|
| mensagens | As mensagens de conversa no formato de chat. | Sim |
| tool_definitions | Definições de ferramenta ou função disponíveis para o agente. | Sim |
Para avaliações de rodada individual (rodada única)
| Campo | Description | Obrigatório |
|---|---|---|
| query | A pergunta ou o prompt do usuário. | Sim |
| response | O modelo ou a resposta do agente. | Sim |
| context | Contexto recuperado em cenários de RAG. | No |
| ground_truth | Resposta correta esperada para comparação. | No |
| tool_calls | Chamadas de ferramenta feitas pelo agente. | No |
| tool_definitions | Definições de ferramentas disponíveis. | No |
O portal tenta mapear automaticamente os campos do conjunto de dados. Se um campo for exibido como Não atribuído, selecione a lista suspensa para atribuir manualmente uma coluna do conjunto de dados.
Nota
Os campos obrigatórios são marcados com um asterisco (*). Os avaliadores falharão se os campos necessários não forem atribuídos.
Etapa 6: Selecionar critérios de teste
Selecione os avaliadores a serem usados para sua avaliação. Microsoft Foundry fornece três categorias de avaliadores internos. Os avaliadores disponíveis dependem do escopo de avaliação.
Avaliadores de Agentes
Avalie como os agentes lidam efetivamente com tarefas, ferramentas e intenção do usuário. Disponível apenas para o escopo Rodadas individuais.
| Avaliador | Description |
|---|---|
| Resolução de Intenção | Mede se o agente identificou e abordou corretamente a intenção do usuário. |
| Adesão à tarefa | Mede o quão bem o agente seguiu as instruções e restrições. |
| Sucesso na chamada de ferramenta | Avalia se as chamadas de ferramenta foram executadas com êxito. |
| Seleção de Ferramentas | Mede se o agente selecionou as ferramentas apropriadas para a tarefa. |
| Utilização da saída da ferramenta | Avalia a eficácia com que o agente usou os resultados das ferramentas nas respostas. |
| Precisão da entrada da ferramenta | Mede se o agente forneceu dados de entrada corretos às ferramentas. |
| Precisão da invocação de ferramenta | Precisão geral do uso da ferramenta. |
Avaliadores de qualidade
Medir a qualidade geral das respostas geradas. A maioria dos avaliadores de qualidade está disponível para todos os escopos de avaliação. Os avaliadores marcados com ★ oferecem suporte tanto à análise no nível da conversa quanto no nível do turno.
| Avaliador | Description | Suporte a conversas |
|---|---|---|
| Satisfação do cliente | Prevê a satisfação do usuário com a interação do agente. | ★ |
| Conclusão da tarefa | Avalia se o agente concluiu com êxito a tarefa solicitada. | ★ |
| Coherence | Mede o fluxo lógico e a consistência das respostas. | ★ |
| Groundedness | Mede se as respostas são fundamentadas no contexto fornecido. | ★ |
| Integridade da resposta | Avalia se as respostas abordam totalmente as consultas do usuário. | — |
| Fluency | Avalia a qualidade da linguagem natural. | — |
| Relevance | Avalia como as respostas relevantes são para a consulta. | — |
Avaliadores de segurança
Identificar possíveis riscos de conteúdo e segurança. Disponível apenas para o escopo Rodadas individuais.
| Avaliador | Description |
|---|---|
| Violência | Detecta conteúdo violento em respostas. |
| Sexual | Detecta conteúdo sexual. |
| Automutilação | Detecta conteúdo relacionado à automutilação. |
| Ódio/injustiça | Detecta conteúdo odioso ou tendencioso. |
O portal preseleciona os avaliadores recomendados com base no seu destino e escopo de avaliação:
- Conversas completas: Satisfação do Cliente, Conclusão da Tarefa, Coerência, Fundamentação
- Turnos individuais (dados existentes): todos os avaliadores do Agente, além dos avaliadores de Qualidade e Segurança
- Turnos individuais (sintéticos/rastros): Relevância, Fundamentação, Fluência, Coerência
Dica
Você pode adicionar ou remover avaliadores conforme necessário. Selecione avaliadores personalizados para usar os avaliadores definidos em seu projeto.
Etapa 7: Examinar e enviar
- Insira um nome para sua avaliação.
- Examine sua configuração:
- Destino e escopo de avaliação
- Fonte de dados e conjunto de dados
- Avaliadores selecionados
- Mapeamentos de campo (se aplicável)
- Selecione Enviar para iniciar a avaliação.
Após você enviar, a execução da avaliação começa. As avaliações normalmente são concluídas em poucos minutos, dependendo do tamanho do conjunto de dados e do número de conversas que estão sendo simuladas.
Para verificar se sua avaliação foi iniciada com êxito:
- No painel esquerdo, selecione Avaliação.
- Encontre sua avaliação na lista. A coluna Status mostra o estado atual:
- Em andamento: a avaliação está em execução.
- Concluído: a avaliação foi concluída com êxito.
- Parcial: alguns avaliadores foram concluídos com sucesso, mas outros falharam.
- Falha: a avaliação encontrou um erro.
Para exibir resultados detalhados, selecione o nome da avaliação ou veja Exibir os resultados da avaliação.
Dica
Para fluxos de trabalho de avaliação programática, use o SDK de avaliação de IA Azure. Veja como executar a avaliação em lote com o SDK.
Solução de problemas
A avaliação atinge o tempo limite ou é executada lentamente
- Reduza o número de conversas ou de linhas do conjunto de dados.
- Para simulações, diminua as voltas máximas por conversa.
- Verifique se o modelo de juiz tem cota suficiente.
Erros de mapeamento de campo
- Verifique se o conjunto de dados contém as colunas necessárias para o escopo de avaliação.
- Para avaliações de conversa, verifique se a coluna de mensagens contém mensagens de chat formatadas corretamente.
- Verifique se os nomes de coluna no conjunto de dados correspondem aos nomes de campo esperados.
Cota de modelo excedida
- O modelo avaliador usado em avaliações assistidas por IA é contabilizado na sua cota do OpenAI do Azure.
- Use um conjunto de dados menor ou aguarde a atualização da cota.
- Considere usar
gpt-4.1-miniem vez degpt-4.1para avaliações econômicas.
Práticas recomendadas
Para avaliações baseadas em simulação
- Comece pequeno: comece com 1 conversa por cenário e 5 a 10 interações para validar sua configuração antes de ampliar.
- Cenários diversos: inclua uma variedade de descrições de cenário para testar diferentes funcionalidades do agente.
- Refine os prompts: Se os agentes se comportarem de forma inesperada, use a etapa Configurar agentes para refinar os prompts.
Para avaliações de conversas existentes
- Exemplo representativo: selecione conversas que representam interações típicas do usuário.
- Inclua casos extremos: não avalie apenas conversas bem-sucedidas — inclua cenários desafiadores.
- Avaliação regular: agende avaliações recorrentes para acompanhar o desempenho do agente ao longo do tempo.
Para avaliações de modelo
- Conjuntos de dados de comparação: use conjuntos de dados padronizados para comparar o desempenho do modelo entre versões.
- Teste tanto as implantações quanto o acesso instantâneo: compare suas implantações com ajuste fino com modelos base.
Para avaliações de conjunto de dados
- Saídas de pré-computação: gere saídas offline e avalie em massa para eficiência de custo.
- Versão de seus conjuntos de dados: acompanhe qual versão do conjunto de dados produziu quais resultados de avaliação.
Dicas gerais
- Comparar avaliadores: passe os mesmos dados por vários avaliadores para obter uma visão abrangente.
- Acompanhar tendências: use o histórico de avaliação para identificar melhorias de desempenho ou regressões.
- Agir com base nos resultados: use as percepções da avaliação para refinar os prompts do agente, as definições das ferramentas e as configurações.
Conteúdo relacionado
Saiba mais sobre como avaliar seus modelos e agentes de IA generativos: