Merk
Tilgang til denne siden krever autorisasjon. Du kan prøve å logge på eller endre kataloger.
Tilgang til denne siden krever autorisasjon. Du kan prøve å endre kataloger.
Notat
Funksjonene i denne artikkelen drives av standardledningsnettet, som bruker faktureringsalternativene beskrevet i Lisensiering for agenter drevet av standardledningsnettet. Lær hvordan du får tilgang til standardfunksjoner i Access standardagenter og agentflyter.
Kjør evalueringer og analyser resultatene for å optimalisere agentens atferd og validere at agenten oppfyller dine forretnings- og kvalitetskrav. Du kan også kjøre et testsett flere ganger for å se endringer over tid etter hvert som du forbedrer agenten din.
Denne artikkelen forklarer hvordan du starter evalueringer og viser resultater ved hjelp av Copilot Studio-grensesnittet. Du kan også kjøre evalueringer ved hjelp av Power Platform API eller connectors lagt til som verktøy eller som en del av automatiseringsflyter i Copilot Studio eller Power Automate.
Testresultatene er tilgjengelige i Copilot Studio i 89 dager. For å lagre testresultatene dine over lengre tid, eksporter resultatene til en CSV-fil.
Kjør en test med et testsett
Etter at du har laget et testsett, kjør en test ved å bruke det settet. Eller kjør tester på nytt ved å bruke det samme settet for å sammenligne resultater over tid og iterasjoner. En test kan ta opptil noen minutter å gjennomføre. Du kan bare kjøre én test om gangen.
Important
Agentevalueringer som bruker brukergodkjenning, krever tilgang via Microsoft Copilot Studio-koblingen. Hvis administratoren din slår av denne tilkoblingen, kan du ikke kjøre tester ved å bruke evalueringsverktøyet. Hvis du vil ha mer informasjon, kan du se Copilot Studio-koblinger og datagrupper.
Gå til agentens evalueringsside .
Kjør en test ved å utføre en av følgende handlinger:
- Når du har laget eller redigert et testsett, velg Evaluer.
- I delen for nylige resultater kan du kjøre en test på nytt ved å gjøre ett av følgende steg:
- Hold pekeren over testresultatet du vil evaluere, og velg ▶ deretter Evaluer (Evaluer testsett på nytt) ved siden av Evaluer agent.
- Velg testresultatet for å åpne det, og velg deretter Kjør-ikonet ▶ i evalueringssammendragsruten .
Hvis brukerprofilen for testsettet har brutte tilkoblinger, eller testsettet ikke har en brukerprofil, vises dialogboksen Behandle profil og tilkoblinger . Du trenger ikke bruke en brukerprofil for testing. Men hvis du bruker en profil, må alle tilkoblingene fungere. Lær mer i Administrer brukerprofiler og forbindelser.
Important
Når du velger en brukerprofil, kan du gjennomgå og autentisere eventuelle koblinger agenten din bruker. Hvis du velger en konto i tillegg til den du bruker for å logge inn på Copilot Studio, for eksempel en testkonto, autentiserer Copilot Studio brukerprofilen og henter brukerens eksisterende tilkoblinger. Du kan konfigurere, gjennomgå og lagre disse tilkoblingene før du gjennomfører en vurdering. Lær mer i Administrer brukerprofiler og forbindelser.
En evaluering tar noen minutter å gjennomføre. Testresultatene behandles i sanntid, linje for linje. Du ser at resultatet av hvert evalueringstesttilfelle vises sekvensielt etter hvert som de genereres. Direkte behandling av testtilfeller gir deg umiddelbar innsyn i kvalitetstrender og potensielle feil mens evalueringen kjører. Du kan stoppe kjøringen når som helst hvis det oppstår problemer. Et varsel vises i Copilot Studio når hele evalueringen er fullført og sammendragsresultatene er klare til å vises.
Notat
Du kan bare kjøre ett evalueringstestsett om gangen. Vent til den gjeldende evalueringen er fullført før du kjører en ny evaluering.
Dykk ned i testresultatene
Hver gang du kjører en evaluering med et testsett, Copilot Studio:
Bruker den tilkoblede brukerkontoen til å simulere samtaler med agenten, og sender hvert spørsmål i testsaken til agenten.
Samler inn agentens svar.
Måler og analyserer suksessen til hvert svar. Hvert testtilfelle mottar en Bestått, Ikke bestått, Ugyldig eller Feil basert på kriteriene i testtilfellet.
Tilordner en passsatspoengsum basert på bestått/feilfrekvens for testsettet.
Du kan se beståttprosenten for hvert testsett som kjøres på agentens evalueringsside , under Nylige resultater. Hvis du vil se flere testsettkjøringer, velger du Se alle.
Se og vurder en detaljert analyse for et testtilfelle
Når du åpner et testresultat, ser du detaljene fra testkjøringen, en liste over spørringene som ble brukt i testen, hvordan agenten svarte, og bestått - eller strykpoengsummen .
Velg et testtilfelle i listen for å se en detaljert vurdering av hvert svar. Velg Alle, Bestått, eller Ikke bestått for å filtrere saker etter resultat.
Vurderingen inkluderer forventede og faktiske svar, begrunnelsen bak testresultatet, samt kunnskapen, temaene og verktøyene agenten brukte for å svare.
Evalueringsresultatene. Dette eksempelet viser resultatene av en kvalitetsevaluering.
Velg Vis aktivitetskart for å se agentens sekvens av input, beslutninger og output i en testsak. Finn ut mer i Vis øktaktivitet.
Transkripsjonen av testspørsmålet og agentens svar.
Ressursene agenten brukte i testen. Velg en for å åpne den.
Du kan gi tilbakemelding til Microsoft om hvor godt evalueringen fungerte for hvert testtilfelle. Denne tilbakemeldingen handler spesifikt om hvor effektivt den valgte evalueringsmetoden vurderte responsen, ikke om selve responsen var korrekt. Tilbakemeldingene dine bidrar til å forbedre kvaliteten og nøyaktigheten i evalueringene over tid.
For å vurdere en evaluering, velg tommel
eller tommel ned
ikonet i panelet for detaljer i testtilfellet. Når tilbakemeldingsskjemaet åpnes, oppgi flere detaljer om vurderingen din, og velg deretter Send inn.
Et evalueringstestsett kan kjøres flere ganger av flere "beslutningstakere" av samme agent. Beslutningstakere kan kjøre evalueringer ved hjelp av testsett som er opprettet av andre beslutningstakere. Beslutningstakere kan se kjørestatusen og resultatmålingene for en testkjøring, men bare oppretteren som startet testkjøringen, kan vise agentsvarene og resultatforklaringene.
Responstid for gjennomgang
Copilot Studio måler automatisk responstiden for hver interaksjon under en evaluering. En interaksjon er en enkelt brukerforespørsel og agentens tilsvarende svar. Responstid er tiden fra ende til slutt, i sekunder, fra agenten mottar forespørselen til den returnerer et svar. Den inkluderer all resonnement, verktøyanrop, koblingssamtaler, forespørsler eller arbeidsflytsteg agenten fullfører før han svarer.
For å se svartiden, velg et testtilfelle-spørsmål i resultatvinduet . Responstidsverdien vises i sekunder i agentens responspanel, etter svaret.
For et enkelt svar-testtilfelle utgjør testspørsmålet og agentens svar én interaksjon. En samtaletestcase kan ha flere interaksjoner, og Copilot Studio måler hver enkelt separat.
Bruk responstid til å identifisere tregere interaksjoner og sammenlign ytelsen etter at du har byttet agent. Responstid er kun en måling. Det tildeler ikke et bestått - eller strykresultat eller påvirker beståttprosenten på testsettet.
Sammenlign testresultater
Du vil teste én versjon av agenten din og se endringer i ytelsen før og etter at du gjør endringer. Du kan sammenligne to kjøringer av samme testsett ved å bruke verktøyet Sammenligning med .
For å se en sammenligning må du kjøre det samme testsettet minst to ganger.
På agentens evalueringsside , under Nylige testresultater, åpner du testkjøringen du ønsker å bruke som base for sammenligningen.
Velg nedtrekksmenyen Sammenlign med , og velg deretter tid og dato for testkjøringen du vil sammenligne med de nåværende åpne testresultatene.
I listen over Test cases viser piler hvilke testcase-resultater som forbedret seg ved å endre fra å feile til å bestå
, eller hvilke som ble forverret ved å endre fra å bestå til å feile
.
Velg et testtilfelle for å se flere detaljer. I panelet for evalueringssammendrag kan du se en direkte sammenligning av testresultater, med resultatet av den nåværende testkjøringen øverst.
Eksporttestresultater
Du kan eksportere testresultater til en CSV-fil. Filen lister opp spørsmålet, forventet svar (hvis aktuelt), testmetode, bestått poengsum (hvis aktuelt), agentens svar, testresultat og analyse for hvert testtilfelle.
- Gå til agentens evalueringsside .
- I delen for nylige resultater eksporterer du et testresultat ved å gjøre ett av følgende steg:
- Hold musepekeren over testtilfellet du vil eksportere, velg de tre prikkene (...) og velg deretter Eksporter testresultater.
- Velg testtilfellet for å åpne det, de tre prikkene (...) i Evalueringsoppsummeringspanelet , og velg deretter Eksporter testresultater.
Testresultatene lastes ned som navnet på testsettet ditt.csv.
Del evalueringer ved hjelp av agent-seer-rollen
Hvis du er agent-eier og kun vil gi tilgang til evalueringssiden til agenten din, del agenten og aktiver rollen for deling av agentseer . Brukere med denne rollen kan administrere evalueringer for en spesifikk agent uten tilgang til agenten selv.
Notat
Agent viewer-rollen gir verken miljø- eller leietakerrettigheter for hele området.
Brukere tildelt rollen som agent viewer for evalueringer:
- Se og kjør evalueringstestsett fra andre produsenter.
- Omdøp, avbryt og slett evalueringer.
- Kan ikke opprette eller oppdatere evalueringstestsettene som deles med dem.
Notat
Brukere som er tildelt rollen som agent viewer kan ikke opprette, oppdatere eller slette agenten eller innholdet utenfor evalueringene hvor de er agent viewer. Brukere kan ikke publisere agenten eller administrere delings- og tilgangsinnstillingene.
Slik tilordner du rollen:
- Åpne agenten og velg de tre prikkene (...) >Del.
- Under Nye brukere og appidentiteter, legg til en bruker eller gruppe. Eller velg en eksisterende bruker fra listen.
- Under Har tillatelser for denne agenten som, velg Agent viewer fra rollelisten.
- Velg Del for å dele agenten.
Brukeren kan da åpne agenten og se fanene Evalueringer og Overvåk. De kan deretter administrere evalueringer under fanen Evaluering .
Lær mer om hvordan du deler en agents vurderinger med andre brukere.