Genie Code für die Beobachtbarkeit und Bewertung von Agenten

Genie Code bietet eine natürliche Sprachschnittstelle zum Verständnis, Debuggen und Verbessern Ihrer GenAI-Anwendungen innerhalb von MLflow. Er hat Lesezugriff auf alles in Ihrem Experiment, von Ablaufverfolgungen, Prompts und Datensätzen bis hin zu Bewertungsläufen, Scorern und Labeling-Sitzungen – sodass Sie Ihre Observability- und Bewertungsdaten im Gespräch erkunden können, anstatt Abfragen zu schreiben oder mehrere Benutzeroberflächen-Seiten zu navigieren.

Um zu beginnen, klicken Sie oben rechts im Arbeitsbereich auf das Genie Code-Symbol, während Sie ein Experiment anzeigen.

Genie-Code für Agenten-Beobachtbarkeit und -Bewertung

Fähigkeiten

Genie Code kann Ihnen bei einer Vielzahl von Beobachtbarkeits- und Evaluierungsaufgaben helfen, darunter:

  • Ablaufverfolgungsanalyse und Debugging: Untersuchen Sie fehlerhafte Ablaufverfolgungen, suchen Sie nach Fehlern, analysieren Sie Span-Bäume, bestimmen Sie die Hauptursachen, analysieren Sie die Latenz und identifizieren Sie Engpässe im Ausführungsablauf Ihres Agenten. Tauchen Sie tief in jede Ablaufverfolgung ein, um deren vollständige Hierarchie zu untersuchen, einschließlich Eingaben, Ausgaben, Metadaten und Tokenverwendung in jedem Schritt.
  • Metriken und Leistung: Berechnen von Latenz-Quantilen (P50/P95/P99), Nachverfolgen von Fehlerraten und Durchsatz im Laufe der Zeit, Analysieren von Tokennutzungsmustern und -kosten und Vergleichen der Leistung über verschiedene Zeiträume oder Filter hinweg.
  • Qualität und Bewertungen: Überprüfen Sie die Bewertungsergebnisse aus menschlichem Feedback, LLM-Richtern und programmgesteuerten Prüfungen. Überprüfen Sie Bewertungsdatensätze, prüfen Sie die registrierten Scorers und deren Konfigurationen, und erhalten Sie Unterstützung beim Einrichten von mlflow.genai.evaluate() mit den passenden Scorers.
  • Kennzeichnung und Überprüfung: Anzeigen von Kennzeichnungssitzungen und Personen, denen die Überprüfung von Ablaufverfolgungen zugewiesen ist, sowie das Überprüfen von Kennzeichnungsschemata, um Feedbackkriterien wie Bewertungen, Kommentare und Erwartungen zu verstehen.
  • Prompt registry: Durchsuchen Sie die Eingabeaufforderungen im Unity-Katalog, und sehen Sie sich Vorlagen, Versionen und Aliase an.
  • Instrumentationsleitfaden: Erhalten Sie Hilfe beim Hinzufügen der Ablaufverfolgung zu Ihrem Code mit autolog(), @mlflow.trace oder manuellen Spans, und nutzen Sie ausführbare Code-Snippets, die Sie direkt in Notebooks von Azure Databricks einfügen können.

Beispielfragen

Hier sind einige Dinge, die Sie genie Code fragen können:

  • „Helfen Sie mir, Probleme mit dem Tool des Agenten zu erkennen, die in den Ablaufverfolgungen für dieses Experiment in den letzten 3 Stunden aufgetreten sind.”
  • "Identifizieren sie Fälle, in denen Benutzer in den Unterhaltungen mit meinem Agenten frustriert werden"
  • Welche Sitzungen haben die niedrigsten Benutzerfeedback-Bewertungen, und was ist in diesen Sitzungen schiefgelaufen?
  • „Was sind die häufigsten Fehlermuster in meinen Ablaufverfolgungen in der letzten Woche, und welche Scorer sollte ich hinzufügen, um sie zu erkennen?”
  • "Welche Abschnitte verbrauchen die meisten Tokens über alle meine Traces hinweg?"
  • Finden von Spuren, bei denen der Retriever keine Ergebnisse zurückgegeben hat, aber der Agent trotzdem versucht hat zu antworten.
  • „Helfen Sie mir bei der Einrichtung der Auswertung für meinen RAG-Agent mit den richtigen Scorern”

Anforderungen

Um Genie Code für Die Beobachtung und Auswertung von Agenten zu verwenden, benötigt Ihr Arbeitsbereich Folgendes:

Weitere Ressourcen