Menschliches Feedback in MLflow

MLflow erfasst menschliches Feedback als Beurteilungen, die an die Traces Ihrer GenAI-App angehängt sind, sodass Sie Bewertungen, Kommentare und Ground-Truth-Erwartungen von Entwicklern, Endnutzern und Domänenexperten erfassen können. Das menschliche Feedback ergänzt die automatisierte Auswertung. Verwenden Sie es, um Datensätze für LLM-Bewerter und Bewertungssysteme zu erstellen und sie mit dem Urteil menschlicher Expertinnen und Experten in Einklang zu halten.

Übersicht zum Datenmodell

MLflow speichert menschliches Feedback als Bewertungen, die an einzelne MLflow-Ablaufverfolgungen angefügt sind. Dies verknüpft Feedback direkt mit einer bestimmten Benutzerabfrage und den Ausgaben und Logik Ihrer GenAI-App.

Es gibt zwei Bewertungstypen:

  1. Feedback: Wertet die tatsächlichen Ausgaben oder Zwischenschritte Ihrer App aus. Beispielsweise beantwortet sie Fragen wie "War die Antwort des Agenten gut?". Feedback bewertet, was die App produziert hat, z. B. Bewertungen oder Kommentare. Feedback bewertet, was von der App generiert wurde und liefert qualitative Einblicke.
  2. Erwartung: Definiert das gewünschte oder richtige Ergebnis (Grundwahrheit), das Ihre App erstellt haben soll. Dies könnte z. B. "Die ideale Antwort" auf die Abfrage eines Benutzers sein. Bei einer bestimmten Eingabe ist die Erwartung immer gleich. Erwartungen definieren, was die App generieren soll und nützlich für die Erstellung von Auswertungsdatensets sind,

Bewertungen können an die gesamte Ablaufverfolgung oder einen bestimmten Bereich innerhalb der Ablaufverfolgung angehängt werden.

Weitere Details zur Ablaufverfolgung finden Sie unter Ablaufverfolgungskonzepte.

Sammeln von Feedback

MLflow hilft Ihnen beim Sammeln von Feedback aus drei Hauptquellen. Jede Quelle ist auf einen anderen Anwendungsfall im Lebenszyklus Ihrer GenAI-App zugeschnitten. Während Das Feedback von verschiedenen Personas stammt, ist das zugrunde liegende Datenmodell für alle Personas identisch.

Feedback der Entwickler

Während der Entwicklung können Sie Spuren direkt annotieren. Dies ist hilfreich, um Qualitätsnotizen nachzuverfolgen, während Sie spezifische Beispiele für zukünftige Referenz- oder Regressionstests erstellen und kennzeichnen.

Informationen zum Kommentieren von Feedback während der Entwicklung finden Sie unter Label während der Entwicklung.

Feedback von einem Domänenexperten

Binden Sie Fachexperten ein, um strukturiertes Feedback zu den Ausgaben Ihrer App zu geben und Erwartungen an die richtigen Antworten zu definieren. Mittels ihrer detaillierten Auswertungen kann definiert werden, wie qualitativ hochwertige Antworten für Ihren spezifischen Anwendungsfall aussehen, und sie sind unschätzbar für die Ausrichtung der LLM-Prüfer an differenzierten geschäftlichen Anforderungen.

Note

Für neue menschliche Review-Workflows empfiehlt Azure Databricks Review-Warteschlangen (Beta). Überprüfungswarteschlangen leiten Ablaufverfolgungen und Datasetdatensätze in einem fokussierten Arbeitsbereich, in dem jeweils nur ein Element bearbeitet wird, an Prüfende weiter. Dabei werden die strukturierten Fragen und die Prüferzuweisung zusammengeführt, die Sie andernfalls mit Bezeichnungsschemas und Bezeichnungssitzungen einrichten würden.

Vorschau-Hero-Image der App ansehen.

MLflow bietet außerdem zwei Ansätze zur Sammlung von Expertenfeedback im Bereich mit der Review App:

Interaktive Tests mit der Chat-UI: Experten interagieren mit Ihrer bereitgestellten App in Echtzeit über eine Chatoberfläche und bieten sofortiges Feedback zu Antworten, während sie Unterhaltungsflüsse testen. Dieser Ansatz eignet sich ideal für "Stimmungsprüfungen" und die qualitative Validierung vor der Bereitstellung in der Produktion. Weitere Informationen finden Sie unter Testen einer App-Version mit der Chat-Benutzeroberfläche.

Markierung vorhandener Traces: Experten überprüfen systematisch und kennzeichnen Traces, die bereits aus Ihrer App erfasst wurden. Dieser Ansatz eignet sich ideal für strukturierte Evaluierungssitzungen, bei denen Experten spezifische Beispiele bewerten und grundbezogene Wahrheitserwartungen definieren. Weitere Informationen finden Sie unter Kennzeichnen vorhandener Ablaufverfolgungen.

Endbenutzer-Feedback

Erfassen Sie in der Produktion Feedback von Benutzern, die mit Ihrer Live-Anwendung interagieren. Dies bietet wichtige Einblicke in die reale Leistung und hilft Ihnen dabei, problematische Abfragen zu identifizieren und erfolgreiche Interaktionen hervorzuheben, die während zukünftiger Updates beibehalten werden sollen. MLflow bietet Tools zum Erfassen, Speichern und Analysieren von Feedback direkt von den Benutzern Ihrer bereitgestellten Anwendungen.

Informationen zum Sammeln von Endbenutzerfeedback finden Sie im Leitfaden zum Sammeln von Endbenutzerfeedback im Ablaufverfolgungsabschnitt.

Weitere Ressourcen