Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Die folgenden Abschnitte gelten für jede Modelländerung, egal ob es sich um ein proaktives Upgrade oder um eine Reaktion auf eine Pensionierung handelt. Definieren Sie zuerst die Gates, erfassen Sie eine Basislinie aus dem aktuellen Modell und arbeiten Sie sich dann durch die Phasen.
Definition von Migrationsakzeptanztoren
Definieren Sie Akzeptanzkriterien vor der Bewertung des Kandidatenmodells, sodass die Agentenbewertung eine Entscheidung und nicht nur eine Menge von Scores ergibt. Einfügen:
- Minimale Gesamtbestehensquote
- Erforderliche Bestehensquote für geschäftskritische Szenarien
- Kritische Ausfälle, die Migration unabhängig vom aggregierten Wert blockieren
- Erlaubte Latenz- und Zuverlässigkeitsvarianz
- Sicherheits-, Compliance- und regionale Bearbeitungsgenehmigung
- Akzeptabler Verbrauch oder Kostenauswirkung
- Erforderliche Unterschrift des Eigentümers und der Freigabegenehmigung
Vergleichen Sie das aktuelle und das Kandidatenmodell, indem Sie dieselbe Agentenkonfiguration, Testdaten, Testset, Benutzerprofile und Umweltannahmen verwenden. Untersuchen Sie individuelle Regressionen, anstatt sich nur auf einen Durchschnittswert zu verlassen.
Die Modellausgaben sind probabilistisch. Führe wichtige Szenarien mehr als einmal durch, wenn Variabilität die Entscheidung beeinflussen kann.
Etablierung einer wiederverwendbaren Bewertungsbasis
Bevor Sie das Modell ändern, erstellen Sie ein Testset, das die geschäftskritischen und hochfrequenten Szenarien des Agenten repräsentiert. Führe den Testsatz mit dem aktuellen Produktionsmodell aus, um eine Basislinie zu etablieren.
Nutzen Sie sowohl Testchat als auch Agentenbewertung:
- Nutzen Sie den Testchat, um vollständige Gespräche zu erkunden und die Orchestrierung mit der Aktivitätskarte zu überprüfen.
- Nutzen Sie die Agentenbewertung, um wiederholbare Testsätze durchzuführen, Ergebnisse zu messen und Läufe über die Zeit zu vergleichen.
Die Ihnen zur Verfügung stehenden Testmethoden hängen vom Geschirr des Agenten ab, also bestätigen Sie diese, bevor Sie das Testset entwerfen. Erfahren Sie mehr unter Bestätigen, welche Testmethoden Ihr Makler unterstützt.
Bewerten Sie das vollständige Verhalten des Agenten
Nehme kein Ersatzmodell zu, nur weil die Gesamtbestehensquote ähnlich wie beim aktuellen Modell ist.
Decken Sie die folgenden Bereiche ab. Jedes davon ist ein Verhalten, das sich häufig ändert, wenn sich das Modell ändert, sodass ein Testset, das einen Bereich auslässt, keine Regression darin erkennen kann.
| Auswertungsbereich | Was ein Modellwechsel zerstören kann | Wie man es überprüft |
|---|---|---|
| Antwortqualität | Relevanz, Vollständigkeit, Genauigkeit, Klarheit und Konsistenz bei den Fragen, die der Agent am häufigsten erhält. | Allgemeine Qualität |
| Bodenständigkeit und Wissen | Das Modell antwortet anhand von Trainingsdaten statt der konfigurierten Wissensquelle, lässt Zitate weg oder behandelt unvollständige oder widersprüchliche Quellen anders. | Allgemeine Qualität |
| Enthaltung | Das Modell beantwortet eine außerhalb des Umfangsbereichs liegende Frage, anstatt abzulehnen oder zu eskalieren. | Allgemeine Qualität oder Custom mit beantworteten und abgelehnten Etiketten |
| Anweisungen folgen | Anweisungen, denen das Modell zuverlässig folgt, werden übersprungen, wie Eskalationsregeln, Grenzen, verbotenes Verhalten oder ein verpflichtender Haftungsausschluss. | Keyword-Abgleich bei den erforderlichen Phrasen oder benutzerdefiniert mit instruktionsspezifischen Labels |
| Feste Werte und Ausgabeformat | Ein präziser Wert wie eine Telefonnummer, ein Code oder eine ID wird umformuliert oder erfunden, oder die Ausgangsform ändert sich und unterbricht einen nachgelagerten Parser oder eine Kanalintegration. | Exakte Übereinstimmung oder Keyword-Übereinstimmung im erforderlichen Format |
| Werkzeugauswahl und Zurückhaltung | Das Modell wählt ein anderes Werkzeug aus, ruft keines auf oder ruft ein Werkzeug auf, wenn kein Werkzeug benötigt wird. | Werkzeugnutzung mit den erwarteten Werkzeugen oder Themen sowie einer Überprüfung der Aktivitätskarte |
| Werkzeugeingaben und Sequenzierung | Parameter werden anders extrahiert, formatiert oder standardisiert, oder Schritte in einer Multitool-Aufgabe werden neu geordnet, zusammengeführt oder weggelassen. | Werkzeugnutzung mit allen erwarteten Werkzeugen plus allgemeine Qualität |
| Bestätigung und Fehlerbehandlung | Das Modell verlangt keine Bestätigung mehr, bevor eine folgenschwere Aktion stattfindet, oder ein Werkzeugfehler wird anders erkannt statt gemeldet. | Benutzerdefiniert mit Bestätigungslabels, plus Schlüsselwortübereinstimmung auf der erwarteten Fehlersprache |
| Mehrfach-Runden-Verhalten | Kontext aus früheren Runden geht verloren oder wird neu interpretiert, oder Klärungen, Themenwechsel und Wiederherstellungen werden anders behandelt. | Allgemeine Qualität eines Konversationstestsets |
| Unübersichtlicher und gegnerischer Input | Schwächere Handhabung von Tippfehlern, Fragmenten und unklarer Absicht oder eine andere Reaktion auf Prompt-Injection und Rollenübersteuerungsversuche. | Allgemeine Qualität sowie Custom mit Refused- und Complied-Etiketten |
| Sicherheit und Compliance | Umgang mit schädlichen Inhalten, Datenzugriff, Berechtigungen, regionale Verarbeitung und verantwortungsbewusste KI-Anforderungen. | Individuelle Labels, zusammen mit einer verantwortungsvollen KI-Bewertung |
| Latenz und Zuverlässigkeit | Reaktionszeit, Auszeiten, Variabilität, fehlgeschlagene Anrufe und Wiederholungen unter repräsentativen Bedingungen. | Nicht durch die Untersuchung gemeldet. Messen Sie in Testchat und Produktionsüberwachung. |
| Verbrauch und Kosten | Copilot Credit-Verbrauch oder andere modellbezogene Kosten für repräsentative Szenarien. | Nicht durch die Untersuchung gemeldet. Messen Sie in Kapazitäts- und Verbrauchsberichterstattung. |
| Sprachen und Kanäle | Qualität und Verhalten über unterstützte Sprachen, Benutzerprofile und Bereitstellungskanäle. | Führe das Testset für jede Sprache, jedes Benutzerprofil und jeden wichtigen Kanal aus |
Achten Sie besonders auf die Befolgung von Anweisungen und die Latenz. Ein Kandidatenmodell kann die Antwortqualität verbessern, aber langsamere Antworten, ein anderes Werkzeugauswahlverhalten oder Fehler in Anweisungen einführen, die mit dem vorherigen Modell zuverlässig waren.
Bestätigen Sie, welche Testmethoden Ihr Agent unterstützt
Die Testmethoden, die Ihrem Makler zur Verfügung stehen, hängen von seinem Gurt ab.
Weitere Informationen finden Sie unter:
- Bewerten Sie Agenten, die vom Standard-Kabelbaum betrieben werden
- Bewerten Sie Agenten, die vom GitHub Copilot-Harness betrieben werden
Aufbau und Wartung des Testsets
- Decken Sie zuerst geschäftskritische Happy Paths und großvolumige Anfragen ab, dann schwierige Fälle: Randfälle, konfrontative Eingaben, Anfragen, die abgelehnt oder eskaliert werden sollten, Werkzeugausfälle, lange Gespräche und mehrsprachige Anfragen.
- Fang mit echtem Verkehr an. Analytische Themen und aufgezeichnete Gespräche erzeugen repräsentativere Testfälle als erfundene.
- Bevorzuge Deckung gegenüber Politur. Eine größere Gruppe unvollkommener Fälle findet mehr Regressionen als eine kleine Gruppe perfekt formulierter Fälle.
- Bewerten Sie zuerst das aktuelle Modell, dann den Kandidaten. Der Vergleich, nicht die absolute Zahl, sagt Ihnen, ob die Migration sicher ist.
- Behalte das Set mit dem Agenten in der Quellkontrolle und führe es bei jedem Modellwechsel unverändert aus.
- Teile das Set nach Risikobereich auf. Ein Testset, das vom Standard-Kabelbaum betrieben wird, kann bis zu 100 Testfälle aufnehmen, daher werden separate Sets für Wissensgenauigkeit, Werkzeugverhalten und sicherheitsrelevante Szenarien verwendet.
- Ergebnisse exportieren. Evaluationsergebnisse werden 89 Tage lang gespeichert, daher werden sie in CSV exportiert, um eine Aufzeichnung darüber zu führen, was jedes Modell zur Migration bewertet hat.
- Umwandeln Sie Produktionsvorfälle und Nutzerfeedback in neue Regressionstests.
Erfahren Sie mehr unter Agentenbewertung Design und Operationalisierung.
Note
Die Agentenbewertung misst Korrektheit und Leistung, nicht KI-Ethik oder Sicherheitsprobleme. Ein Agent kann jeden Testfall bestehen und trotzdem eine unangemessene Antwort liefern. Verwenden Sie verantwortungsvolle KI-Überprüfungen und Inhaltssicherheitsfilter zusammen mit der Bewertung.
Automatisieren Sie wiederkehrende Bewertungen
Copilot Studio unterstützt die Durchführung von Bewertungen über die Power Platform API, sodass Sie Modellvalidierung in Release-Workflows und kontinuierliche Integrationspipelines integrieren können. Für ein großes Makler-Estate ist die Automatisierung das, was wiederholte Kandidatentests nachhaltig und nicht manuell macht. Erfahren Sie mehr in Automate Evaluations mit der Power Platform API.
Aktualisieren Sie die Agent-Artefakte, die eine Modelländerung beeinflusst
Eine Modelländerung betrifft selten nur die Modelleinstellung. Übersetze die relevanten Anbieter-Empfehlungen in die von dir kontrollierten Agentenartefakte und validiere dann jede Änderung anhand deiner Bewertungsbasis. Eine Sanierung, die nicht erneut getestet wird, ist eine Vermutung.
| Artefakt | Typische Veränderung |
|---|---|
| Anweisungen für den Agent | Machen Sie implizite Erwartungen explizit, entfernen Sie Workarounds, die für das vorherige Modell geschrieben wurden, formulieren Sie Grenzen und Eskalationsregeln sowie verbotenes Verhalten eindeutig um, lösen widersprüchliche Anweisungen und kalibrieren Sie, wie viel eigenständiges Handeln der Agent ergreifen sollte. |
| Themen- und Knotenanweisungen | Wenden Sie dieselbe Behandlung auf Themenebene an und überprüfen Sie, ob sich die generativen Antwortknoten weiterhin wie erwartet verhalten. |
| Werkzeug- und Aktionsbeschreibungen | Neu formulieren, um Klarheit zu schaffen. Diese Beschreibung liest das Modell, um zu entscheiden, ob und wann ein Tool aufgerufen wird, und vage Beschreibungen verursachen sowohl Über- als auch Unteraufruf. |
| Beschreibungen von Ein- und Ausgabeparametern | Verschränke das Format, die Einheiten, Beispiele und die erforderlichen oder optionalen Semantiken, damit die Parametergenerierung korrekt bleibt. |
| Konfiguration der Wissensquelle | Überprüfe die Anweisungen zur Quellenauswahl, Scoping und Erdung erneut und überprüfe das Zitierverhalten. |
| Anweisungen zur Antwortformatierung | Formulieren Sie die erforderliche Struktur, Länge, Haftungsausschlüsse und exakten Werte explizit wieder, da neuere Modelle die Standard-Verbosität ändern. |
| Bestätigung und Sicherheitstore | Bekräftigen Sie explizite Bestätigungsanforderungen vor konsequenten Handlungen. |
| Nachgelagerte Verbraucher | Aktualisieren Sie Power Automate-Flows, adaptive Karten, Kanalintegrationen und jeden Parser, der die Agentenausgabe liest. |
| Der Testsatz selbst | Fügen Sie die neuen Fehlermuster hinzu, die während der Migration entdeckt wurden. |
Migrationsphasen
Die folgenden Phasen ordnen die vorangegangenen Abschnitte in der Reihenfolge der Ausführung ein. Nutzen Sie sie als Arbeitsplan für die Modelländerung eines einzelnen Agenten, egal ob die Änderung proaktiv ist oder durch eine Pensionierung getrieben wird.
Phase 0: Vorbereitung
- Bestätigen Sie, dass das Kandidatenmodell gegen die Voraussetzungen gültig ist: allgemein verfügbar oder Standard, verfügbar in der Region, Cross-Geo-Posture akzeptabel, administrator-aktiviert und die richtige Nutzungskategorie für den Zweck des Agenten.
- Lesen Sie die Upgrade-Richtlinien des Modellanbieters und notieren Sie die Anleitung und Werkzeugänderungen, die sie implizieren.
- Identifizieren Sie die betroffenen Stoffe anhand des Inventars, der Aufzeichnungsumgebung, der Eigentümer und der Kritikalität.
- Bestätigen Sie, welche Bewertungstestmethoden das Harness des Agenten unterstützt.
- Definieren und genehmigen Sie die Gates zur Migrationsakzeptanz.
Phase 1: Ausgangslage des aktuellen Modells
- Erstellen oder aktualisieren Sie das Regressionstestset, sodass es geschäftskritische und hochfrequente Szenarien abdeckt.
- Führe den Testsatz gegen das aktuelle Produktionsmodell aus, um die Basislinie zu bestimmen. Mach das, solange das aktuelle Modell noch besteht, denn nach der Modelländerung kann die Basislinie nicht rekonstruiert werden.
- Erfassen Sie den Verbrauch von Latenz und Copilot-Kredit getrennt. Bewertungen melden sie nicht.
- Exportiere die Ergebnisse in CSV, um den Datensatz über das Aufbewahrungsfenster hinaus zu bewahren.
Phase 2: Bewertung des Kandidaten in einer nicht-produktiven Umgebung
Bereiten Sie eine nicht-produktive Kopie des Agenten vor, die den Anweisungen von Copilot Studio für das Management des Anwendungslebenszyklus und das Agententesten folgen. Konfigurieren Sie die Umgebung so, dass sie die Produktion darstellt:
- Verwenden Sie dieselben Agentenanweisungen, Themen, Wissenskonfigurationen, Tools, Flows, Connectors, Sprachen und Sicherheitsannahmen.
- Verwenden Sie repräsentative Testidentitäten und Verbindungen.
- Wenden Sie dieselben Datenrichtlinien und relevanten Administratorkontrollen an.
- Bestätigen Sie die regionale Verfügbarkeit und ob eine Bewegung von Datenquerschnitten erforderlich ist.
- Notiere alle Unterschiede zwischen Test und Produktion, die das Ergebnis beeinflussen könnten.
Ändere das Modell. Gehen Sie zur Übersichtsseite des Agenten und wählen Sie im Bereich Modell das primäre Modell des Kandidaten aus. Es gibt separate Einstellungen für tiefgehendes Denken, generative Antworten und den Prompt-Builder, also prüfen Sie, ob der Agent diese Funktionen nutzt und ob sie ebenfalls geändert werden müssen.
Führe denselben Testsatz unverändert mit dem Kandidatenmodell erneut durch.
Vergleichen Sie die beiden Durchläufe mit den Akzeptanzgattern, um Verbesserungen und Regressionen zu identifizieren.
Überprüfen Sie die Orchestrierung qualitativ im Testchat, indem Sie die Aktivitätskarte verwenden, um zu bestätigen, welche Werkzeuge ausgewählt wurden, in welcher Reihenfolge und mit welchen Parametern.
Messen Sie Latenz und Verbrauch für den Kandidaten und vergleichen Sie sie mit dem Ausgangswert.
Phase 3: Wartung
- Aktualisieren Sie die Agentenartefakte, die die Modelländerung beeinflusst, und führen Sie dann das Testset gegen den remedierten Agent erneut aus. Erfahren Sie mehr in Improve agents mit evaluationsgetriebener Triage und Sanierung.
- Iterieren Sie, bis die Annahmegrenzen erfüllt sind, oder stellen Sie fest, dass das Kandidatenmodell nicht geeignet ist, und dokumentieren Sie, warum. Die Entscheidung, nicht aufzurüsten, ist ein legitimes, evidenzbasiertes Ergebnis.
Phase 4: Genehmigung und Einsatz
- Erhalten Sie die Zustimmung zu den Akzeptanzsperren vom Agenteninhaber und den Freigabe-Genehmigungsempfänger, einschließlich Sicherheits- und Compliance-Genehmigung, wenn es um Cross-Geo- oder externe Modelle geht.
- Bereite sie über den etablierten ALM-Prozess aus und bewerben Sie die Lösung vom Test bis zur Produktion. Bearbeiten Sie den Produktionsagenten nicht manuell.
- Führe den Rollout in Phase , wenn der Kanal es erlaubt. Veröffentlichen Sie zuerst ein Pilotpublikum oder einen einzelnen Kanal, beobachten Sie das Ergebnis und erweitern Sie es dann.
Phase 5: Überwachen und schließen
- Überwachen Sie das Produktionsverhalten anhand der Akzeptanztore.
- Fügen Sie neu entdeckte Fehlermuster dem Regressionstestset hinzu.
- Schließen Sie die Migration erst, wenn die Akzeptanzkriterien in der Produktion erfüllt sind .
- Bewahren Sie die Bewertungsbelege und den Entscheidungsdatensatz für die Migration für das Audit und für das nächste Lebenszyklusereignis auf.
Important
Der Rollback-Pfad für eine Modelländerung besteht darin, die zuvor validierte Lösung neu auszurollen, was langsamer ist als ein Konfigurationsumschalter. Dieser Unterschied macht das Evaluationstor in Phase 2 so wichtig. Eine Regression vor dem Einsatz zu erkennen, ist günstiger als eine danach rückgängig zu machen.
Überwachung nach der Migration
Die Modelllebenszyklusarbeit wird nach der Bereitstellung fortgesetzt. Überwachen:
- Ergebnisse der Agentenbewertung und Bestehensquoten kritischer Szenarien.
- Produktionsanalysen, Transkripte, Aktivitäten, Fehler und Nutzerfeedback.
- Fehlern bei der Befolgung von Anweisungen und bei der Werkzeugauswahl.
- Latenz, Auszeiten und Zuverlässigkeit.
- Der Konsum verändert sich.
- Sicherheits-, Compliance- und regionale Verarbeitungsfragen.
Wenn die Produktionsüberwachung ein neues Fehlermuster erkennt, fügen Sie dem Regressionstestsatz einen repräsentativen Fall hinzu. Diese Praxis verbessert die nächste Modellbewertung und verwandelt Produktionslernen in eine dauerhafte Qualitätsbasis.
Die Telemetrie auf Umweltebene sendet OpenTelemetrie-GenAI-Spanne in Application Insights, einschließlich des Modells, das für jede Agentenaufrufung verwendet wird. Nutzen Sie es, um zu bestätigen, auf welchem Modell der Produktionsverkehr tatsächlich läuft, und um die Auswahl und Zuverlässigkeit der Werkzeuge vor und nach einer Migration zu vergleichen.