Anvend evalueringstriage-rammen gennem praktiske scenarier

Disse trin-for-trin gennemgange viser, hvordan lagene i evaluerings-triagerammen fungerer sammen i praksis. Hvert forløb starter fra et unikt evalueringsscenarie og følger en særskilt diagnostisk sti.

Gennemgangene viser, hvordan man anvender evaluerings-triagerammen trin for trin. Brug disse eksempler til at forstå, hvordan du går fra evalueringsresultater til diagnose, afhjælpning og verificering i realistiske scenarier for evaluering af agenter.

Tip

Inden du går i gang med disse eksempler, bør du gennemgå rammeværkets mål, herunder kernebegreber og principper.

Kampagneforløb Udgangssituation Hvad det viser
Rejse 1 Første evalueringsrunde End-to-end-flow: Fortolkning → Prioritering → Triage → Afhjælpning → Verificering
Rejse 2 Scorer flader ud efter flere gentagelser Mønsteranalyse, omklassificering og omgåelse af platformbegrænsninger
Rejse 3 Scorerne falder efter en ændring Regressionsdetektion, diagnose af instruktionskonflikter og håndtering af afvejninger

Bemærk!

Disse eksempler er illustrative og baseret på fælles mønstre, der er observeret på tværs af flere kundeevalueringskørsler. Testcases, scores og agentoplysninger er repræsentative sammensætninger og ikke data fra et enkelt forløb. De viste diagnostiske tilgange og afhjælpningsstrategier afspejler praksis, der anvendes i virkelige implementeringer.

Forløb 1: Første evalueringsrunde

Du afvikler din evalueringssuite for første gang på en kundesupportagent. Her er resultaterne:

Evalueringssæt Gennemførselsfrekvens
Sikkerhed og personlige data 100%
Spørgsmål og svar om Core Business 87 %
Vidensforankring 71 %
Værktøjskald 92 %
Udløserrouting 88 %
Tone og kvalitet 83 %
Eskalering 90 %
Overordnet 85 %

Trin 1: Fortolk scorer (Lag 1)

Brug tabellen til fortolkning af scores til at kalibrere tærskler og identificere, hvilke evalueringssæt der ligger under blokeringstærsklerne.

Evalueringssæt Score Tærskel Status
Sikkerhed og personlige data 100% 95 % spærring Adgangskort
Spørgsmål og svar om Core Business 87 % 80 % spærring Adgangskort
Vidensforankring 71 % 80 % spærring Under blokeringstærskel
Værktøjskald 92 % 85 % spærring Adgangskort
Udløserrouting 88 % 80 % spærring Adgangskort
Tone og kvalitet 83 % 75 % spærring Adgangskort
Eskalering 90 % 85 % spærring Adgangskort

Parathedsvurdering: Gentag. Vidensgrundlag er under sin blokeringsgrænse. Fokuser afhjælpning der.

Trin 2: Prioriter fejl (Lag 2, Trin 0)

Situation: Vidensgrundlag har syv testcases. To testcases fejler: KG-003 og KG-005. Begge testcases indgår i et kerneforretningsevalueringssæt og har derfor prioritet 2. Da der kun er to, triage begge.

Reference: Prioriter fejl (Lag 2, trin 0)

Trin 3: Triage KG-003 (Lag 2, trin 1-2)

Testsag KG-003:

  • Eksempelinput: "Hvad er jeres returpolitik?"
  • Forventet svar: "Vi tilbyder 30 dages returret for alle køb."
  • Agentens svar: "Vores returpolitik tillader retur inden for 15 arbejdsdage efter købet."
  • Evalueringsmetode: Nøgleordsmatch
  • Resultat: Ikke bestået (forventet "30-dage", agenten sagde "15 arbejdsdage")

Verificér evalueringsopsætningen (trin 1 i lag 2):

Spørgsmål Besvar Resultat
Er agentens svar acceptabelt? Tjek kildedokumentet. Tjek kilden først.
Er det forventede svar stadig aktuelt? Kildedokumentet siger "15 hverdage." Politikken blev opdateret. Antal Det forventede svar er forældet.

Klassificering: Problem med evalueringsopsætning. Forældet forventet svar. Agenten har ret. Vurderingen er forkert.

Trin 4: Triage KG-005 (Lag 2, trin 1-2)

Testsag KG-005:

  • Eksempelinput: "Inkluderer Premium-planen en udvidet garanti?"
  • Forventet svar: "Premium-planen inkluderer en toårig standardgaranti." Udvidede garantimuligheder kan købes separat.
  • Agentens svar: "Ja, Premium-planen inkluderer en treårig udvidet garanti, der dækker alle dele og arbejdskraft."
  • Evalueringsmetode: Sammenlign betydning
  • Resultat: Fejl (agenten fabrikerede garantidetaljer)

Verificér evalueringsopsætningen (trin 1 i lag 2):

Spørgsmål Besvar Resultat
Er agentens svar acceptabelt? Antal "Treårig udvidet garanti" er opdigtet. Fortsæt
Er det forventede svar aktuelt? Ja. Kilden bekræfter to års standardgaranti. Fortsæt
Er testen realistisk? Ja. Typisk kundespørgsmål. Fortsæt
Kunne et alternativt svar være korrekt? Antal Garantioplysningerne er faktuelle. Fortsæt
Er evalueringsmetoden passende? Ja.Sammenlign betydning er korrekt for semantisk nøjagtighed. Evalueringen er gyldig.

Diagnosticér agenten (trin 2 i lag 2):

Spørgsmål Besvar
Er kildeindholdet forkert? Antal Kilden siger "to års standardgaranti."
Modsagde agenten oplysningerne i kilden? Ja. Kilden siger "to års standardgaranti," men agenten sagde "tre års udvidet garanti."
Svarede agenten uden at bruge nogen kilde? Sandsynligvis ja. Detaljen "treårig udvidet garanti, der dækker alle dele og arbejde" findes ikke i nogen kilde.

Klassifikation: Agent konfigurationsproblem. Manglende vidensgrundlag. Agenten har genereret garantioplysninger, som ikke findes i de konfigurerede videnskilder.

Trin 5: Afhjælp (lag 3)

KG-003 (Afhjælpning af evalueringsopsætning):

  • Ændring: Opdater forventet værdi fra "30-dages returvindue" til "15 arbejdsdage"
  • Genkør: kun KG-003
  • Forvent: Godkendt

KG-005 (Agentkonfigurationsafhjælpning):

  • Ændring: Tilføj jordforbindelsesinstruktion til systemprompten: "Svar kun baseret på information fundet i dine videnskilder. Hvis oplysningerne ikke er tilgængelige, så sig det."
  • Genkør: Fuld vidensgrundlagsevaluering (ændring af agentkonfiguration kan have bredere effekter)
  • Forvente: KG-005 passerer. Andre testcases må ikke gå tilbage.

Trin 6: Bekræft

Efter begge ændringer, genkør evalueringssættet for vidensgrundlag:

Før Efter
71% (5/7 bestået) 86% (6/7 bestået)

Vurdering: Vidensgrundlaget er nu over 80 % blokeringsgrænsen. Én fejl (KG-007) er tilbage og blokerer ikke paratheden. Gennemgå det i næste gentagelse.

Trin 7: Dokumentér (Lag 4)

Registrér i fejlloggen:

Testsag Rodårsagstype Problem, der er observeret Anvendt ændring Løst
KG-003 Evalueringsopsætning Forventet svar er forældet (politikken ændret fra 30 dage til 15 hverdage). Opdateret forventet værdi Ja
KG-005 Konfiguration af helpdesk-medarbejder Forkerte garantidetaljer, som ikke findes i nogen kilde. Tilføjet forankringsinstruktion til systemprompten Ja

Mønsternote: Verificér forventede værdier mod kildedokumenter før hver evalueringskørsel. Tilføj dette trin til tjeklisten for før-evaluering.

Parathedsgenkontrol: Alle evalueringssæt er nu over blokeringstærskel.

Parathedsvurdering: Implementer agenten med kendte huller (KG-007 dokumenteret, overvågningsplan på plads).

Reference: Lag 4: Analyser mønstre og forbedr løbende din agent

Rejse 2 - Scoreplateau

Situation: Du kører fire gentagelser på en produktsupportagent. Faktuel nøjagtighed forbliver på 78% gennem alle fire gentagelser. Du ændrer prompten efter hver gentagelse, men oplever ingen forbedring.

Trin 1: Gennemgå mønstre (lag 4)

Gennemgå fejlloggen på tværs af alle fire gentagelser:

Gentagelse Score Anvendt ændring Resultat
1 78 % (grundlinje)
2 79 % Tilføjet "Vær præcis med produktspecifikationerne" Ingen væsentlig ændring
3 77 % Prompten er blevet omorganiseret, så nøjagtighedsinstruktionerne kommer først Ingen væsentlig ændring
4 78 % Tilføjede gennemarbejdede eksempler på korrekte produktsvar Ingen væsentlig ændring

Trend: Flad. Remediering adresserer ikke den egentlige rodårsag.

Reference: Lag 4: Analyser mønstre og forbedr løbende din agent

Trin 2: Analyser fejlende testcases

Gennemgå de seks vedvarende fejl på tværs af alle gentagelser.

Testsag Fejler siden Problem, der er observeret
FA-002 Gentagelse 1 Agenten citerer FAQ-siden i stedet for produktmanualen
FA-005 Gentagelse 1 Agenten citerer FAQ-siden i stedet for produktmanualen
FA-008 Gentagelse 1 Agenten citerer FAQ-siden i stedet for produktmanualen
FA-011 Gentagelse 1 Agenten citerer FAQ-siden i stedet for produktmanualen
FA-014 Gentagelse 1 Agenten citerer FAQ-siden i stedet for produktmanualen
FA-019 Gentagelse 2 Agenten giver et delvist svar fra FAQ, overser detaljer fra manualen

Analyse af fejlklynger: Fem ud af seks fejl (83%) involverer samme rodårsag: Agenten henter information fra FAQ-siden i stedet for produktmanualen.

Trin 3: Re-triage (Lag 2)

Klassificer fejlene indledningsvist som agentkonfigurationsproblem: Forkert kilde hentet.

Foretag flere ændringer i agentkonfigurationen, herunder prompt-omformulering, omorganisering og tilføjelse af eksempler. Disse ændringer resulterer ikke i målbar forbedring. På dette tidspunkt skal du validere fejlen op imod platformbegrænsningsindikatorer.

Indikator Check
Fejlen fortsætter på tværs af flere prompt- eller konfigurationsvariationer Ja. Fire gentagelser uden ændring.
Hentning returnerer konsekvent forkerte dokumenter trods korrekt kildekonfiguration Ja. FAQ'en hentes konsekvent i stedet for produktmanualen.

Omklassificering: Dette problem skyldes en platformbegrænsning relateret til rangering ved hentning. Platformen prioriterer konsekvent FAQ'en frem for produktmanualen for disse forespørgsler, og yderligere ændringer i prompt eller instruktion påvirker ikke hentningsadfærden.

Reference: Lag 2: Triage af agentfejl

Trin 4: Afhjælp (Lag 3—Platformbegrænsning)

Når du klassificerer en fejl som en platformbegrænsning, skal du fokusere rettelsen på workarounds og dokumentation i stedet for at ændre agentkonfigurationen.

Reference: svar på platformbegrænsning

Workaround-strategi: Anvend en eller flere af følgende afbødningsmetoder for at reducere påvirkningen:

  • Omstrukturer produktmanualen med klarere afsnitsoverskrifter, der stemmer overens med det ordforråd, der bruges i brugerforespørgsler.
  • Dupliker kritiske produktspecifikationer fra manualen ind i FAQ'en for at skabe redundante hentningsstier.
  • Omstrukturér indholdet i manualen, så hver sektion besvarer et enkelt, veldefineret spørgsmål for at forbedre matchningen ved informationssøgning.

Disse tilgange har til formål at påvirke hentningsadfærd uden at ændre på prompts eller instruktioner.

Eskalering og sporing: Hvis begrænsningen fortsætter, skal den dokumenteres og eskaleres til platformteamet.

  • Dokumentér begrænsningen således: "Forespørgsler om <produktspecifikationer> henter konsekvent FAQ-siden (sidst opdateret: <dato>, <n> sider) i stedet for produktmanualen (sidst opdateret: <dato>, <N> sider), selvom manualen indeholder de autoritative oplysninger."
  • Tilføj dokumentation: Inkluder flere testtilfælde, der viser forespørgslen, den forventede kilde og den faktisk hentede kilde.
  • Indsend til undersøgelse.
  • Del den dokumenterede begrænsning og evidens med platformteamet for tracking og opfølgning.

Trin 5: Bekræft

Efter at have omstruktureret produktmanualen og tilføjet overflødige FAQ-poster, skal du genafkode det relevante evalueringssæt for at verificere effekten.

Før Efter
78% (uændret på tværs af fire gentagelser) 89 %

Vurdering: Løsningen forbedrer den samlede præstation. Der er én fejl tilbage (FA-019). Forespørgslen er for tvetydig til pålideligt at hente den korrekte kilde, selv med omstruktureret indhold. Denne fejl er registreret som en kendt begrænsning.

Trin 6: Dokumenter

Opdater fejlloggen for at afspejle den endelige klassifikation og resultaterne.

Testsag Rodårsagstype Problem, der er observeret Anvendt ændring Løst
FA-002, 005, 008, 011, 014 Platformbegrænsning Søgerangeringen prioriterer FAQ'en over produktmanualen Omstrukturerede manuelle overskrifter; duplikerede kritiske specifikationer i FAQ'en Ja
FA-019 Platformbegrænsning En tvetydig forespørgsel kan ikke pålideligt hente den korrekte kilde Dokumenteret som en kendt begrænsning Nej

Vigtig pointe: Hvis evalueringsscorerne forbliver uændrede over flere prompt- eller instruktionsændringer, er rodårsagen næppe prompten. Valider infrastruktur og platformens funktion, før du investerer mere i prompt engineering.

Forløb 3: Regression efter opdatering

Situation: Du opdaterede systemprompten for at forbedre tone og empati. Tonevurderingerne steg, men den faktiske nøjagtighed faldt under blokeringstærsklen, hvilket medførte en regression.

Før ændringen:

Evalueringssæt Score
Faktisk nøjagtighed 91 %
Tone og kvalitet 83 %
Alle andre Over tærsklen

Du tilføjede følgende instruktion til systemprompten: "Anerkend altid kundens bekymring og vis empati, før du giver dit svar." Start hvert svar med at validere kundens oplevelse.

Efter ændringen:

Evalueringssæt Før Efter Delta
Faktisk nøjagtighed 91 % 76 % -15 %
Tone og kvalitet 83 % 91 % +8 %

Trin 1: Fortolk (Lag 1)

Faktuel nøjagtighed er nu under blokeringsgrænsen på 80%. Denne ændring introducerer en regression og blokerer for parathed.

Reference: Lag 1: Fortolk scorene og identificer fejl

Trin 2: Gennemgå mønstre (lag 4)

Cross-signal mønstermatch: Tonen forbedres, mens nøjagtigheden forringes.

Angivet årsag: Instruktionskonflikt.

Den nyligt tilføjede tonevejledning konkurrerer med nøjagtighedsinstruktioner om modellens opmærksomhed.

Reference: Lag 4: Analyser mønstre og forbedr løbende din agent

Trin 3: Triagering af de nye fejl (Lag 2)

Gennemgå testcases for faktuel nøjagtighed, der bestod før ændringen og nu fejler.

Testsag FA-007:

  • Input: "Hvad er den maksimale filuploadstørrelse?"
  • Forventet: "Den maksimale filuploadstørrelse er 25 MB for standardkonti og 100 MB for erhvervskonti."
  • Agent før: "Den maksimale filuploadstørrelse er 25 MB for standardkonti og 100 MB for erhvervskonti."
  • agent efter: "Jeg forstår fuldt ud din bekymring om filuploadstørrelser – det kan være frustrerende, når du prøver at uploade vigtige dokumenter!" Jeg vil sikre mig, at du har alle de oplysninger, du har brug for. Den maksimale uploadstørrelse er 25 MB for standardplaner."

Trin 1. Verificér evalueringen: Det forventede svar er korrekt, og evalueringen er gyldig. Svaret efter opdateringen udelader detaljen om virksomhedskontoen.

Trin 2. Diagnosticer: Den nye tonevejledning kræver en empatisk indledning i hvert svar. Dette krav bruger svarbudget og modellens opmærksomhed, og det fører til ufuldstændige faktuelle svar.

Klassifikation: Agent konfigurationsproblem. Instruktionskonflikt mellem tone- og nøjagtighedsvejledning.

Reference: Lag 2: Triage af agentfejl

Trin 4: Afhjælp (lag 3)

Problemet er ikke selve tonevejledningen, men konkurrerende prioriteter i system prompten. Afhjælpning fokuserer på at adskille og prioritere instruktioner.

Gammel instruktion (enkelt, konkurrerende): "Anerkend altid kundens bekymring og vis empati, før du giver dit svar." Start hvert svar med at validere kundens oplevelse.

Ny instruktion (adskilt, prioriteret): "Inkluder altid det komplette faktuelle svar på kundens spørgsmål." Udelad ikke detaljer for korthedens skyld. Derudover, når kunden udtrykker frustration eller bekymring, så anerkend det kort.

Nøgleændringer:

  • Nøjagtighed prioriteres eksplicit.
  • Faktuelle svarenes fuldstændighed angives direkte.
  • Empati er betinget snarere end universel.
  • "Kort" begrænser empati for at forhindre afkortning af indhold.

Reference: Lag 3: Kortlæg fejlmønstre til remedieringsstrategier

Trin 5: Bekræft

Kør hele evalueringssættet igen, da ændringer i systemprompten kan påvirke bredt.

Evalueringssæt Før ændring Efter regression Efter ændring
Faktisk nøjagtighed 91 % 76 % 90 %
Tone og kvalitet 83 % 91 % 89 %
Alle andre Over tærsklen Over tærsklen Over tærsklen

Vurdering: Begge signaler opfylder nu deres blokeringsgrænser. Tone vender ikke helt tilbage til sit topniveau, men den forbliver betydeligt over 75% blokeringsgrænsen og forbedrer det oprindelige grundniveau.

Trin 6: Dokumenter

Testsag Rodårsagstype Problem, der er observeret Anvendt ændring Løst
FA-007, FA-012, FA-018 (og andre) Konfiguration af helpdesk-medarbejder Tonevejledning fortrængte faktuel fuldstændighed Prompten blev omstruktureret for at prioritere nøjagtighed og anvende betinget empati Ja

Vigtig pointe: Valider altid ændringer i systemprompt mod hele evalueringssuiten, ikke kun målsignalet. Instruktioner konkurrerer om modellens opmærksomhed, og forbedringer på ét område kan føre til regressioner i andre.

Mønster at holde øje med: Dette scenarie er et eksempel på problemet med instruktionsbudget. Efterhånden som prompts vokser, bliver instruktionskonflikter mere sandsynlige. Periodisk konsolidering og forenkling hjælper med at opretholde stabilitet.

Fælles mønstre på tværs af rejser

Hver rejse starter fra et unikt scenarie for at illustrere et særskilt diagnostisk forløb. For at se, hvordan en enkelt agent bevæger sig gennem hele evalueringslivscyklussen—scorefortolkning, fejltriage, udbedring og verifikation—kan du gennemgå Journey 1, som tilbyder den mest fuldstændige end-to-end gennemgang.

Denne tabel fremhæver tilbagevendende mønstre, der observeres på tværs af rejserne, samt de praktiske lektioner, de forstærker.

Mønster Hvor den vises Vigtig takeaway
Valider evalueringen før agenten Rejse 1 En almindelig kilde til spildt indsats er fejlfinding af agentadfærd, når selve evalueringen er forkert.
Flade scorer indikerer, at rodårsagen er fejlagtigt klassificeret Rejse 2 Hvis gentagen afhjælpning ikke forbedrer resultaterne, skal problemet omklassificeres. Du arbejder måske med den forkerte rodårsag.
Kør hele evalueringssuiten igen efter promptændringer Rejse 3 prompt-ændringer kan påvirke flere kvalitetssignaler. Kontroller altid for regressioner uden for målområdet.
Dokumentér resultater og beslutninger Alle kampagneforløb At føre en fejllog forhindrer genopdagelse af de samme rodårsager i senere gentagelser.
Kendte mangler kan accepteres Forløb 1 (KG-007), Forløb 2 (FA-019) Ikke alle fejl behøver at blive løst, før produktet frigives. Dokumentér kendte mangler og overvåg dem over tid.

Næste trin

Efter at have gennemgået disse eksempler, vælg den næste handling, der bedst passer til din nuværende situation: