Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
Efter du har sorteret individuelle testcasefejl, kan du anvende rettelser og stadig se ringe eller ingen forbedring i agentens samlede ydeevne. Dette resultat peger ofte på et systemisk problem fremfor en række isolerede fejl.
Mønsteranalyse hjælper dig med at se på tværs af flere mislykkede testtilfælde for at identificere tilbagevendende signaler og fælles rodårsager. Brug mønsteranalyse til at fokusere på ændringer, der adresserer grupper af fejl på én gang, i stedet for at rette hver enkelt fejl isoleret.
Vigtigt!
Brug denne vejledning, efter du har gennemført fejltriage og anvendt ændringer i udbedringen. Mønsteranalyse er mest nyttig efter, at du har triageret mindst fem fejl.
Hvornår bør du bruge mønsteranalyse
Mønsteranalyse er mest nyttig, når du observerer en eller flere af følgende betingelser:
- Mange fejl i det samme evalueringssæt.
- Gentagne fejl med lignende symptomer.
- Forbedringer af enkelte testcases, der ikke påvirker de samlede resultater.
- Forbedringer på ét område, der forårsager regressioner på et andet.
At rette fejl én efter én er ineffektivt i disse situationer. Mønsteranalyse hjælper dig med at identificere, hvad fejlene har til fælles, så du kan adressere den underliggende årsag.
Koncentrationsanalyse
Efter du har klassificeret individuelle fejl, skal du kigge efter mønstre i hele sættet.
| Mønster | Hvad det betyder | Anbefalet handling |
|---|---|---|
| 80 % eller flere fejl skyldes opsætningsproblemer i evalueringen | Evalueringssuiten skal kalibreres, ikke ændres på agenten | Sæt agent-gentagelsen på pause. Gennemgå og ret evalueringskvaliteten først, derefter kør igen for at få et rent signal. |
| 80% eller flere fejl er agentkonfigurationsproblemer i ét område (for eksempel alle vidensrelaterede) | Konfigurationsmangel for systemagent | Fokuser afhjælpningen på det område. Dette problem er ofte et arkitekturproblem (for eksempel videnskildestruktur), ikke individuelle testcase-rettelser. |
| 80% eller flere fejl er platformbegrænsninger | Agenten når platformgrænserne | Genvurder agentens omfang. Eskaler til platformteam. Juster tærskler eller behandl berørte elementer som kendte begrænsninger, hvor det er relevant. |
| Fejl fordeles jævnt på tværs af rodårsagstyper | Der er ikke et enkelt systemisk problem | Fortsæt afhjælpningen sag for sag ved hjælp af afhjælpningstilknytning. |
Sådan udfører du koncentrationsanalyse
Optæl dine klassificerede fejl efter grundårsagstype:
- Problemer med opsætning af evaluering
- Agentkonfigurationsproblemer
- Platformbegrænsninger
- Ikke-klassificerede
Beregn procentdelen for hver type.
Hvis en type er 80% eller højere—hvilket indikerer et systemisk problem—ret kategorien, ikke individuelle tilfælde.
Hvis agentkonfigurationsproblemer samler sig om ét kvalitetssignal (for eksempel hvis fem ud af seks relaterer til videnforankring), peger det mønster på en arkitektonisk rodårsag.
Krydssignalmønstre
Når fejl forekommer på tværs af flere evalueringssæt, peger de ofte på en fælles rodårsag. Se efter følgende mønstre:
| Mønster | Hvad det sandsynligvis indikerer | Hvad skal man undersøge |
|---|---|---|
| Både faktuel nøjagtighed og vidensforankring fejler | Problem med videnskilde (forkert, manglende, utilgængelig eller forældet) | Videnskonfiguration, indekseringsstatus og indholdets friskhed |
| Værktøjskald og trigger-routing fejler begge | Problem med orkestreringskonfiguration—emner og værktøjer er ikke korrekt forbundet | Gennemgå, hvordan emner rutes til værktøjer. Tjek for frakoblede eller forkert konfigurerede flows. |
| Tone svigter, men nøjagtigheden er korrekt | Agenten får det rigtige svar, men leverer det dårligt | Fokus på promptstil-instruktioner; infrastrukturen for nøjagtighed fungerer godt. |
| Sikkerhed er korrekt, men nøjagtigheden svigter | Agenten kan være alt for restriktiv—for forsigtig, og nægter at svare, når den burde | Gennemgå sikkerhedsinstruktioner for restriktioner, der er for brede og blokerer legitime svar. |
| Alle passerer undtagen grænsetilfælde | Kerneadfærden er solid | Fokuser på at udvide robustheden i yderområderne; dette mønster er et godt tegn. |
| Nøjagtigheden forbedres, men tonen forringes | Instruktionskonflikt—nye præcisionsinstruktioner kan være ved at fortrænge tonevejledning | Gennemgå de seneste promptændringer og hav "instruktionsbudgettet" i tankerne. |
| Flere evalueringssæt degraderer alle samtidig | Sandsynligvis en enkelt rodårsag med bred indvirkning | Tjek for nylige ændringer i systemprompt, opdateringer af videnskilde eller opdateringer af platformmodellen. |
Hvad man skal gøre med krydssignalmønstre
- Identificer den fælles rodårsag: Hvis to signaler fejler samtidig, deler de sandsynligvis en afhængighed, f.eks. en videnskilde, prompt-sektion eller værktøjskonfiguration.
- Løs den fælles afhængighed: Løs ikke hvert signal individuelt.
- Kør begge evalueringssæt igen: Efter rettelsen, bekræft, at begge sæt viser forbedring.
- Hvis kun én viser forbedring, har signalerne ikke en fælles rodårsag. Triager de resterende fejl uafhængigt.
Trendanalyse på tværs af gentagelser
Følg hvordan scores ændrer sig gennem dine gentagelser for at forstå, om din udbedringsstrategi virker.
| Tendens | Fortolkning | Handling |
|---|---|---|
| Scorer forbedres på tværs af gentagelser | Oprydningen virker | Fortsæt, indtil tærsklerne er nået. |
| Scorer flade trods ændringer | Remediering adresserer ikke den reelle rodårsag | Foretag en ny triage; rodårsagsklassifikationen kan være forkert. |
| Scorerne falder efter en ændring | Regression—ændringen forårsagede en fejl | Rul ændringen tilbage. Undersøg, hvad der regresserede, og hvorfor. |
| Et evalueringssæt forbedres, et andet forringes | Kompromis—løsning af én dimension gik ud over en anden | Undersøg kobling, ofte forårsaget af instruktionskonflikt (henvis til Journey 3). |
| Score svinger mellem kørsler (mere end +/-10% variation) | Graderinstabilitet eller agent-ikke-determinisme | Valider først bedømmerens pålidelighed (henvis til Grader-validering). Kør mindst tre gange pr. gentagelse. |
Opbygning af en trendoversigt
Efter hver gentagelse skal du registrere:
- Dato
- Foretaget ændring
- Evalueringssæt
- Score før
- Score efter
- Delta
Denne information hjælper dig:
- Bekræft, at der sker konvergens mod tærsklerne
- Identificer regressioner hurtigt
- Opdag plateauer tidligt (Journey 2)
Dokumentér fejl
Strukturerede fejloptegnelser opbygger institutionel viden på tværs af gentagelsescyklusser. Uden dokumentation gentager teams ofte det samme undersøgelsesarbejde.
Hvorfor dokumentere fejl
- Hurtigere triage i fremtiden: Du genkender straks kendte fejlmønstre.
- Opbyg dokumentation til eskalering: Saml platformbegrænsninger for at styrke sager over for platformteamet.
- Understøt teamlæring: Loggen hjælper med at forhindre duplikerede undersøgelser, når flere personer arbejder på den samme agent.
- Registrér kendte udeståender: Glem ikke at registrere fejl, der er markeret som "løses ikke" eller "kendt begrænsning."
Brug fejllogskabelonen
Brug fejllogskabelonen til at registrere fejl i et let eller detaljeret format, afhængigt af teamstørrelse og procesmodenhed.
Hvad skal registreres
Som minimum bør følgende oplysninger dokumenteres for hver triageret fejl:
- Hvilket testtilfælde fejlede.
- Hvilken årsagstype du klassificerede det som.
- Hvad gik galt helt præcist.
- Hvad du ændrede for at rette det.
- Om rettelsen virkede.
For uløste fejl, dokumenter desuden:
- Det du har prøvet indtil nu.
- Hvorfor det stadig er uløst.
- Hvornår du skal revurdere (for eksempel "efter platformopdatering X").
Løbende forbedringsarbejdsgang
Brug denne tjekliste efter hver triage- og udbedringscyklus for at bekræfte, at du har dokumenteret resultaterne og de næste skridt.
Tjekliste efter gentagelse
| Færdig? | Opgave |
|---|---|
| ✓ | Registrer alle triagerede fejl i fejlloggen. |
| ✓ | Identificer og noter koncentrationer af rodårsager. |
| ✓ | Kontroller krydssignalmønstre. |
| ✓ | Notér scores for trendsporing. |
| ✓ | Dokumentér kendte begrænsninger med midlertidige løsninger |
| ✓ | Identificer prioriteter for næste gentagelse baseret på de resterende fejl. |
| ✓ | Angiv tidsplan for genkørsel (hvilke evalueringssæt, hvornår). |
Stop gentagelse, når
Stop gentagelse, når:
- Alle evalueringssæt ligger over tærskelværdierne.
- Kendte mangler er dokumenteret.
- Scorerne er konsistente (< 5 % varians).
- Ingen åbne agentkonfigurationsproblemer for blokerende signaler.
Stop ikke gentagelse, når:
- Du undersøgte ikke vedvarende fejl.
- Du fjernede hårde testcases for at nå tærskler.
- Du dokumenterede ikke platformbegrænsninger.
Lær mere under Bestem hvornår gentagelsen er afsluttet.
Næste trin
- Gennemgå praktiske eksempler , der demonstrerer, hvordan rammelagene arbejder sammen i virkelige scenarier.
- Brug fejllogskabelonen til at spore dine fund.