Merk
Tilgang til denne siden krever autorisasjon. Du kan prøve å logge på eller endre kataloger.
Tilgang til denne siden krever autorisasjon. Du kan prøve å endre kataloger.
Etter hvert som KI-agenter tar på seg kritiske roller i forretningsprosesser, blir behovet for pålitelig og repeterbar testing avgjørende. Agentevaluering lar deg opprette tester som simulerer realistiske scenarioer for agenten. Disse testene dekker flere spørsmål og samtaler raskere enn manuell, sak-for-sak-testing. Deretter kan du måle nøyaktigheten, relevansen og kvaliteten på svarene fra agentens samhandlinger, basert på informasjonen agenten har tilgang til. Ved hjelp av resultatene fra testsettet kan du optimalisere agentens virkemåte og validere at agenten oppfyller forretnings- og kvalitetskravene dine.
Hvorfor bruke automatisert testing?
Agentevaluering gir automatisert, strukturert testing. Det hjelper til med å oppdage problemer tidlig, reduserer risikoen for dårlige svar, og opprettholder kvaliteten etter hvert som agenten utvikler seg. Denne prosessen gir en automatisert, repeterbar form for kvalitetssikring til agenttesting. Den sørger for at agenten oppfyller virksomhetens nøyaktighets- og pålitelighetsstandarder og gir åpenhet om hvordan den presterer. Det har andre styrker enn testing ved å bruke testnettpraten.
Du kjører evalueringer og ser resultater via Copilot Studio-grensesnittet, gjennom Power Platform REST-API-er, eller ved å legge til handlinger i verktøy, flyter eller Power Automate.
Agentvurdering måler korrekthet og ytelse, ikke KI-etikk eller sikkerhetsproblemer. En agent kan bestå alle evalueringstester, men likevel f.eks. gi et upassende svar på et spørsmål. Kunder bør fortsatt bruke ansvarlige KI-vurderinger og innholdssikkerhetsfiltre; evalueringer erstatter ikke disse vurderingene og filtrene.
Government Community Cloud-begrensninger
Agentevaluering i Government Community Cloud (GCC)-miljøer har følgende begrensninger:
Utviklere kan ikke legge til brukerprofil i testsettene sine. Likevel kan utviklere fortsatt kjøre evalueringer uten brukerprofil.
Utviklere kan ikke bruke likhetstestmetoden for evalueringer. Alle andre testmetoder er tilgjengelige.
Slik fungerer agentevaluering
Copilot Studio bruker et testtilfelle for hver agentevaluering. Et testtilfelle er en enkelt samhandling som simulerer hvordan en bruker ville samhandle med agenten din. Samhandlingen kan være et enkelt spørsmål eller en hel samtale.
Et testtilfelle kan også inkludere svaret du forventer at agenten din skal svare med. Eksempel:
Spørsmålet: Hva er åpningstidene?
Forventet svar: Vi har åpent fra kl. 09.00 til 17.00 mandag til fredag.
Ved å bruke agentevaluering kan du generere, importere eller manuelt skrive en gruppe testtilfeller. Denne gruppen av testtilfeller kalles et testsett. Et testsett lar deg:
Kjør flere testtilfeller som dekker et bredt spekter av egenskaper samtidig, i stedet for å stille agenten din ett spørsmål om gangen.
Analyser agentens ytelse med en lettfattelig samlet poengsum, og gå i dybden på individuelle testtilfeller.
Test endringer på agentene dine ved å bruke det samme testsettet, slik at du har en objektiv standard for å måle og sammenligne endringer i ytelse.
Opprett raskt nye testsett eller endre eksisterende for å dekke endrede egenskaper eller krav til agenten.
Hvert testsett kan evaluere agenten din ved hjelp av flere testmetoder samtidig.
Du kan også velge en brukerprofil som skal fungere som den stimulerte brukeren. Agenten kan være konfigurert til å respondere forskjellig til ulike brukere, eller gi tilgang til ressurser på ulike måter.
Når du velger et testsett og kjører en agentevaluering, sender Copilot Studio spørsmålene i testtilfellene, registrerer agentens svar, sammenligner disse svarene med forventede svar eller en kvalitetsstandard, og tildeler en poengsum til hvert testtilfelle. Du kan også se detaljene, transkripsjonen og aktivitetskarten for hvert testtilfelle, samt hvilke ressurser agenten din brukte for å lage svaret.
Lag en omfattende evalueringsstrategi
Før du kjører evalueringer, definer hva som er suksess for din agent og avgjør hvilke scenarioer som er viktigst for forretningsresultatene. En gjennomtenkt strategi hjelper deg å velge riktige testmetoder, prioritere testscenarioer med stor betydning og tolke resultatene i relevant kontekst.
Bruk Utforming av agentløsninger: Evalueringsrammeverk for å kartlegge forretningsmål til målbare evalueringsdimensjoner og poengsettingsmetoder.
Bruk Utform og operasjonaliser agentevaluering for å etablere en repeterbar evalueringsprosess som støtter kontinuerlige kvalitetsforbedringer.
Integrer evalueringer i automatisk flyt
Agentevaluering støtter automatisering slik at utviklere kan utføre evalueringer uten manuell inngripen. Ved å bruke REST-API-er eller Power Platform-koblinger kan du programmatisk utløse evalueringskjøringer og integrere testing i automatiserte arbeidsflyter som rørledningene kontinuerlig integrasjon og kontinuerlig distribusjon (CI/CD). Denne tilnærmingen gjør det mulig å kjøre testsett i stor skala og validere agentatferd etter hvert som endringer innføres, uten å kreve manuell kjøring i Copilot Studio.
Testnettprat kontra agentevaluering
Hver testmetode gir deg ulike innsikter i agentens kvaliteter og atferd:
Mottar og svarer på ett spørsmål om gangen. Det er vanskelig å gjenta de samme testene flere ganger.
Lar deg teste en hel økt med flere meldinger.
Lar deg samhandle med agenten din som en bruker ved å bruke et nettpratgrensesnitt.
Agentevaluering:
Kan opprette og kjøre flere testtilfeller samtidig ved å bruke et testsett. Du kan gjenta tester ved å bruke det samme testsettet.
Du kan teste ett spørsmål og ett svar per testtilfelle, eller én samtale per testtilfelle. Men du har mindre kontroll over samtalene enn du ville hatt når du bruker testnettpraten.
Velg ulike brukerprofiler for å simulere forskjellige brukere uten å måtte fullføre samhandlingene selv.
Når du tester en agent, bruker du både testnettpraten og agentvurderingen for å få et helhetlig bilde av agenten din.
Språkstøtte i agentevaluering
Copilot Studio-agenter støtter ulike språk. Hvis du konfigurerer agenten din til å støtte mer enn ett språk, kan du velge språket du ønsker for en gitt evaluering.
For en flerspråklig agent har følgende evalueringskomponenter spesifikke egenskaper:
Spørringsgenerering
Standardspråket er språket du primært bruker når du legger inn evalueringsinndata. Velg språket du vil bruke for evalueringen Når du kjører flere evalueringer, er utdataene på samme språk som inndata.
Grader-kjøring
Når du evaluerer en flerspråklig agent, sammenligner evalueringsmetoden sammenlign betydning det forventede svaret med agentens svar. Hvis det oppstår et problem relatert til flere språk, oppdager systemet avviket, sammenlign betydning-graderingen feiler svaret, og svaret markeres som mislykket på grunn av språkinkonsekvens.
Forklaringsutdata
I samtaler med flere runder med en flerspråklig agent, gir agenten begrunnelser på det samme språket som den bruker i sine svar.
Begrensninger
For øyeblikket støtter ikke agentevaluering Fabric-dataagenter.