Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
Når evalueringsresultater afslører fejl, er den næste udfordring at vide, hvad du skal gøre med dem. Prioriterings- og udbedringsrammen er en struktureret metode til at fortolke resultater, diagnosticere fejl, identificere ejerskab og kortlægge problemer til specifikke rettelser – uden at du skal finde den forkerte rodårsag eller optimere resultater isoleret. Denne artikel introducerer dit frameworks mål, struktur og forudsætninger, så du systematisk kan gennemgå evalueringsresultater og gøre din agent klar til produktion.
Det hjælper et framework dig med at gøre
Dit framework er en struktureret metode til at gå fra resultater til handling, da det hjælper dig med følgende:
- Fortolke evalueringsresultater i kontekst
- Prioritere fejl ud fra risiko og konsekvens
- Undersøge, hvorfor en testsag mislykkedes
- Skelne mellem:
- Problemer med evalueringsopsætning
- Problemer med konfiguration af agent
- Platforms- eller mulighedsbegrænsninger
Hvert diagnosticeret problem er knyttet til en specifik afhjælpningshandling, som kan testes.
Målet er ikke at optimere resultatet isoleret, men at fokusere indsatsen der, hvor det forbedrer agentens adfærd i den virkelige verden.
Dette framework giver mulighed for kontinuerlig forbedring i den bredere livscyklus:
- Design og lav agenten
- Evaluer adfærd med strukturerede test.
- Prioritér og løs problemer ved hjælp af disse artikler.
- Genvurder og gentag, i takt med at agenten udvikler sig.
Ved at behandle evalueringsresultater som handlingsbare signaler kan du effektivt gå fra eksperimenter til gentagelige, produktionsklare agenter.
Rammeværksstruktur
Dit framework er organiseret i fire prioriteringslag. Hvert lag svarer til et dybere analyseniveau fra fortolkning af resultater til diagnosticering af rodårsager og identifikation af systemiske mønstre.
- Lag 1: Fortolk evalueringsresultater, og vurder parathed: Hvad betyder resultaterne, og er agenten klar til implementering?
- Lag 2: prioritering af fejl: Hvorfor virkede dette ikke, og hvem skal tage affære?
- Lag 3: Kortlæg fejlmønstre til udbedringsstrategier: Hvad bør specifikt ændres?
- Lag 4: Analysér mønstre og forbedr: Hvilke systemiske problemer afslører fejlene?
Dit framework indeholder også praktiske eksempler, der viser, hvordan det anvendes fra start til slut, samt en skabelon til fejllogfiler, der hjælper dig med at holde øje med resultater og beslutninger.
Hurtigreferencen er en forkortet version af prioriterings- og afhjælpningsprocessen, som kan bruges i aktive sessioner.
Rodårsagstyper
Evalueringsfejl er kortlagt til en af tre grundlæggende årsager baseret på ejeren, eller hvem der skal handle.
| Rodårsagstype | Ejer | Beskrivelse |
|---|---|---|
| Problem med evalueringsopsætning | Evalueringsforfatter | Testsagen, det forventede svar eller vurderingsmodulet er forkert. Agenten fungerer muligvis korrekt. |
| Problem med konfiguration af agent | Agentgeneratoren | Agenten genererer et forkert svar, som kan rettes med konfigurationsændringer. |
| Platformbegrænsningsproblem | Platformteam | Platformens adfærd forårsager problemet, og det kan ikke løses med konfigurationsændringer. |
Designprincipper
Designprincipper hjælper dig med at anvende dit framework i praksis, så du får en effektiv prioritering og afhjælpning.
| Princip | Hvad det betyder i praksis |
|---|---|
| Tag udgangspunkt i evalueringsresultater | Begynd med rigtige beståelsesprocenter og mislykkede testsager – ikke abstrakte antagelser. |
| Fjern forkert arbejde først | Kontroller evalueringsopsætningen, før du undersøger agenten, så du ikke spilder tiden. |
| Årsag → ejer → handling | Sørg for, at hver diagnosticeringsproces identificerer en klar ejer og en konkret handling. |
| Verificer klassifikation | Kør evalueringerne igen efter udbedring. Prioriter igen, hvis fejlene fortsætter. |
| Forvent sammensatte årsager | Anerkend, at en enkelt fejl kan have flere medvirkende årsager. |
| Tag højde for variation | Tag højde for variation i modeller og bedømmere. Kør evalueringer igen for at bekræfte resultaterne. |
Evalueringssæt-arkitektur
Prioriteringens effektivitet afhænger af, hvordan evalueringssæt er struktureret.
- Velstrukturerede sæt (organiseret efter kvalitetssignal eller scenarie) giver fortolkelige resultater og effektiv prioritering.
- Dårligt strukturerede sæt (blandede signaler, uklare grænser) giver støjende resultater og tvetydige diagnoser.
Hvis resultaterne er svære at fortolke, bør du overveje at omstrukturere evalueringssættene, før du håndterer individuelle fejl.
Inden du starter
Du skal have tilgængelige evalueringsresultater, herunder et bestået eller ikke-bestået udfald, for hver testsag. Hvis du endnu ikke har kørt evalueringer, skal du følge trinnene i Automatiser test med agentevaluering og læse Design og udnyt agentevaluering for at få yderligere vejledning.
Næste trin
Begynd med at fortolke dine evalueringsresultater for at vurdere parathed.