Asteria Docs
Evaluierungen

Die Ergebnisse lesen

Die Bewertungsübersicht, das Raster Fall für Fall, und der Vergleich, der Ihnen sagt, ob eine Änderung geholfen hat.

Datensatz ausführen, einen auswählen, und er bewertet die aktuelle Revision Ihres Agenten gegen jeden Fall. Sie können dem Fortschritt zusehen und abbrechen: noch nicht gestartete Fälle werden übersprungen, und Fälle, die bereits laufen, werden zuerst zu Ende geführt.

Die Bewertungsübersicht

Die Kennzahl ganz oben ist bestandene Fälle, zum Beispiel „14/20 Fälle bestanden“, und ein Fall besteht, wenn alle seine wertenden Prüfungen bestehen. Daneben sehen Sie unter Umständen:

  • eine Zahl unvollständiger Fälle, die nicht fertig wurden
  • eine Zahl von Fällen ohne anwendbare Prüfungen, die eine Untersuchung wert ist: die wurden überhaupt nicht bewertet
  • Info, als Kennzeichen für Prüfungen, die verfolgt werden, aber nie einen Fall durchfallen lassen

Jagen Sie nicht der 20/20 hinterher. Ein Datensatz, der immer die volle Punktzahl holt, sagt Ihnen nichts mehr, und meist heißt das, dass die heiklen Fälle fehlen. Irgendwo in den hohen Zehnern, mit einer stabilen Menge bekannter Fehlschläge, ist ein gesünderer Ort.

Fälle × Evaluatoren

Ein Raster: eine Zeile pro Fall, eine Spalte pro Prüfung, damit Sie auf einen Blick sehen, ob ein Fehlschlag ein schlechter Fall oder eine schlechte Prüfung ist.

Jede Zelle ist Bestanden, Fehlgeschlagen, Übersprungen, Fehler oder Kein Schwellenwert (bewertet, aber ohne gesetzte Schwelle). Öffnen Sie eine Zelle für die Punktzahl, den Schwellenwert, gegen den geurteilt wurde, und die Begründung des Jurors.

Lesen Sie die Begründung, bevor Sie handeln. Oft hatte der Agent recht und die Prüfung unrecht, und das ist ein Hinweis, Ihr Kriterium zu reparieren statt Ihren Agenten.

Zwei Muster, nach denen Sie suchen sollten:

Eine überwiegend fehlschlagende Spalte ist ein Problem mit der Prüfung, oder mit etwas Systematischem. Zwanzig Fälle fallen nicht alle zufällig bei Faithfulness durch.

Eine überwiegend fehlschlagende Zeile ist ein schwerer Fall. Lesen Sie ihn: manchmal ist er wirklich unfair, häufiger ist er der interessante.

Der Rest eines Laufs

Zusammenfassung ist ein geschriebener Kommentar dazu, wie der Lauf gelaufen ist, erzeugt, sobald er abgeschlossen ist. Sie können ihn neu generieren lassen.

Schritte und Tool-Aufrufe zeigen, was der Agent pro Fall tatsächlich getan hat. Hier finden Sie heraus, dass er die Sammlung nie durchsucht hat.

Artefakte enthält alles, was er erzeugt hat.

Trace-ID ist für Ihre Administratoren. Wenn Ihre Organisation Traces sammelt, findet diese ID die vollen Details.

Zwei Läufe vergleichen

Der Grund, das alles überhaupt zu tun.

Vergleichen mit…, dann wählen Sie einen anderen abgeschlossenen Lauf desselben Datensatzes. Sie bekommen:

Score-Differenzen pro Evaluierer, Lauf A gegen Lauf B, mit dem Unterschied.

Spec-Änderungen zwischen beiden, denn ein Lauf hält fest, welche Revision des Agenten er benutzt hat. Sie sehen also, dass sich die Punktzahl bewegt hat, und was sich geändert hat: bearbeitete Anweisungen, hinzugefügte oder entfernte Werkzeuge, geänderte Temperatur, angeheftete oder gelöste Sammlungen.

Score-Änderungen pro Fall, und hier steckt das nützliche Detail. Ein unveränderter Durchschnitt kann vier besser gewordene und vier schlechter gewordene Fälle verstecken, und das ist meist interessanter als der Durchschnitt.

Vergleichen Sie Läufe desselben Datensatzes. Über Datensätze hinweg zu vergleichen sagt Ihnen nichts, und deshalb bietet der Dialog nur Läufe desselben Datensatzes an.

Revisionen

Jedes Speichern eines Agenten erzeugt eine Revision. Die Ansicht Versionen listet sie mit einer Kurzfassung auf (Anweisungen, wie viele Werkzeuge, Sub-Agenten, angeheftete Sammlungen) und lässt Sie zwei auswählen und mit Vergleichen genau sehen, was sich geändert hat.

Kombinieren Sie das mit dem Lauf-Vergleich, und Sie können die Frage beantworten, für die es diese Funktion gibt: hat das, was ich am Dienstag geändert habe, es besser gemacht?

Die Übersicht

Evaluierungen in der linken Leiste zeigt den Auswertungsstatus über alle Agenten, auf die Sie Zugriff haben, mit Nur Auffälliges anzeigen.

Trends zeichnen eine Linie der Bestehensquote über die letzten Läufe.

Eine gestrichelte Lücke in einer Trendlinie markiert einen Versionswechsel bei einem Evaluierer. Die Werte links und rechts davon sind nicht vergleichbar, deshalb wird die Linie durchtrennt statt verbunden.

Das ist eine bewusste Weigerung, eine beruhigende Linie durch einen Bruch zu ziehen. Wenn Sie eine sehen, lesen Sie nicht darüber hinweg.

Sie sehen unter Umständen auch Läufe, die als vor einer Überarbeitung der Bewertung liegend markiert sind. Deren Zahlen sind mit den heutigen nicht vergleichbar. Ältere Läufe werden aus den Trends ausgeschlossen, statt still untergemischt zu werden.

Was Sie mit einem Fehlschlag tun

Lesen Sie zuerst die Begründung. Lag der Agent falsch, oder die Prüfung?

Prüfen Sie, ob er seine Werkzeuge genutzt hat. Eine selbstsichere Antwort ohne Suche in der Sammlung ist der klassische Fehlschlag, und er wird meist in den Anweisungen behoben, nicht am Modell.

Ändern Sie eine Sache, dann lassen Sie neu laufen. Anweisungen und Fälle gemeinsam zu ändern heißt, dass Sie aus dem Ergebnis nichts lernen.

Behalten Sie den fehlgeschlagenen Fall. Sobald er besteht, ist er ein Fall, der nie wieder still zurückfallen kann.

On this page