Prüfungen wählen
Die Arten von Evaluierer, wofür jede taugt, und wie ein Fall am Ende besteht oder durchfällt.
Ein Evaluierer ist eine Prüfung, die auf jeden Fall angewendet wird. Sie wählen sie am Datensatz und können sie pro Fall überschreiben.
Sie kommen in fünf Gruppen, und die nützliche Unterscheidung ist billig und sicher gegen teuer und urteilend.
Verhaltensbasiert: billig, deterministisch
Mechanische Prüfungen, ganz ohne Modell. Sie kosten nichts und geben immer dieselbe Antwort.
- Ausgabetyp passt: kam es in der erwarteten Form zurück?
- Latenz unter Schwelle: war es schnell genug?
- Tools genutzt: hat er die Werkzeuge aufgerufen, die er hätte aufrufen sollen?
Tools genutzt ist nützlicher, als es aussieht. Stellen Sie es so ein, dass es prüft, ob der Agent Ihre Sammlung durchsucht hat, statt aus dem Gedächtnis zu antworten, und Sie fangen damit den häufigsten stillen Fehlschlag ab. Es lässt sich außerdem umkehren: es besteht, wenn die Werkzeuge nicht genutzt wurden. So prüfen Sie eine Schutzmaßnahme („dieser Agent darf nie E-Mails senden“).
Fangen Sie hier an. Diese Prüfungen sind kostenlos und finden echte Probleme.
Strukturiert: hält es sich an die Dokumente?
Für Agenten, die aus einer Sammlung antworten. Sie zerlegen die Antwort und gleichen sie mit dem gefundenen Material ab.
- Faithfulness: ist jede Aussage durch die Dokumente gedeckt, oder wurde ausgeschmückt?
- Antwortrelevanz: beantwortet es die gestellte Frage überhaupt?
- Kontext-Präzision und Kontext-Recall: hat die Suche das richtige Material gefunden, und genug davon?
Faithfulness ist die, die Sie laufen lassen sollten, bei jedem Agenten, dessen Aufgabe es ist, aus Ihren Dokumenten zu antworten. Es ist die Prüfung auf selbstsicheres Erfinden, also den Fehlschlag, den die Leute am meisten fürchten und am seltensten testen.
Die beiden Kontext-Prüfungen sind Diagnose: wenn Faithfulness in Ordnung ist, die Antworten aber dünn bleiben, sagen sie Ihnen, ob das Problem beim Agenten liegt oder bei der Sammlung darunter.
Heuristisch: ein Juror mit einer Rubrik
Ein Modell bewertet jede Antwort gegen eine allgemeine Rubrik.
- Vollständigkeit: hat es abgedeckt, was es sollte?
- Sicherheit: gibt es hier irgendetwas Problematisches?
Schnell und qualitativ. Behandeln Sie die Punktzahlen als Signal, nicht als Messung: es sind Meinungen, und sie schwanken zwischen Läufen ein wenig.
Datenaufgabe: ist das Artefakt richtig herausgekommen?
Für Agenten, die Tabellen und Diagramme erzeugen. Diese Prüfungen vergleichen das Ergebnis mit einer erwarteten Form: Tabellenform, Spalten, Schema, Werte, Diagrammtyp, dazu ein Gesamturteil zur Datenanalyse-Qualität.
Nur relevant, wenn Ihr Agent Datenartefakte erzeugt. Sonst ignorieren.
Benutzerdefiniert: Ihr eigenes Kriterium
Mit Eigenen Evaluierer hinzufügen schreiben Sie die Prüfung selbst. Eine Bezeichnung (die zur Spaltenüberschrift in den Ergebnissen wird) und ein Kriterium in normaler Sprache.
Im Kriterium steckt die Arbeit. Vage Kriterien erzeugen bedeutungslose Punktzahlen:
Schwach: Die Antwort hat gute Qualität.
Stark: Nutzt unsere Hausbegriffe: "Mitglied" statt "Nutzer", "Tarif" statt "Paket". Verspricht nie einen konkreten Zeitplan. Endet mit einem nächsten Schritt, den die Leserin gehen kann.
Der Dialog schlägt vor, die Skala zu verankern, und das lohnt sich. Dasselbe Kriterium, ergänzt um die Beschreibung der beiden Enden:
Verankert: 0 = nutzt "Nutzer" oder "Paket", oder verspricht einen Zeitplan. 1 = nutzt durchgehend "Mitglied" und "Tarif", verspricht keinen Zeitplan, und endet mit einem nächsten Schritt.
Ein Juror, dem man sagt, wie 0 und 1 aussehen, ist weit einheitlicher als einer, der „gut“ selbst auslegen muss.
Fügen Sie so viele hinzu, wie Sie brauchen, jeden mit einer eigenen Bezeichnung.
Wie ein Fall besteht oder durchfällt
Das zu verstehen lohnt sich, denn die Kennzahl ganz oben hängt daran.
Jede Prüfung erzeugt eine Punktzahl von 0 bis 1, und manche haben einen Schwellenwert: liegt die Punktzahl darauf oder darüber, besteht die Prüfung. Eine Prüfung ohne Schwellenwert wird bewertet und angezeigt, hat aber keine Bestehensgrenze, und die Ergebnisse weisen sie auch so aus, statt etwas vorzutäuschen.
Ein Fall besteht, wenn alle seine wertenden Prüfungen bestehen. Übersprungene und fehlerhafte Prüfungen zählen nicht gegen ihn.
Wertend ist hier das wichtige Wort. Eine Prüfung kann als informativ markiert werden: sie wird bewertet, angezeigt und über die Zeit verfolgt, lässt aber nie einen Fall durchfallen. Nutzen Sie das für Dinge, die Sie beobachten, aber nicht blockieren lassen wollen, etwa einen stilistischen Juror, dessen Meinung nicht darüber entscheiden soll, ob ein Lauf grün ist.
Wiederholungen: führen Sie einen Fall mehrfach aus, wird die mittlere Punktzahl genommen, und der Fall besteht nur, wenn jede Wiederholung besteht. Das ist Absicht: eine Antwort, die zwei von drei Malen besteht, ist keine bestehende Antwort, sondern eine unzuverlässige, und unzuverlässig ist ein Signal und kein Rauschen.
Ein vernünftiges Set wählen
Für die meisten Agenten starten Sie mit:
- Tools genutzt, um zu bestätigen, dass er sucht statt rät
- Faithfulness, wenn er aus Dokumenten antwortet
- Ein eigener Juror für das, was „richtig“ in Ihrem Job bedeutet
Drei Prüfungen, die Sie verstehen, schlagen neun, die Sie nicht verstehen. Sie können sagen, was ein Fehlschlag bedeutet, und darum geht es.
Fügen Sie weitere hinzu, wenn ein echter Fehlschlag an denen vorbeirutscht, die Sie haben, und nehmen Sie informativ statt wertend für alles, dem Sie noch nicht ganz trauen.
Jede modellbasierte Prüfung (strukturiert, heuristisch, benutzerdefiniert, und der Datenanalyse-Juror) kostet einen Modellaufruf pro Fall, zusätzlich zum Ausführen des Agenten selbst. Zwanzig Fälle mit vier Juroren sind achtzig Juror-Aufrufe pro Lauf.
Die Ansicht Kosten schlüsselt die Evaluierungsausgaben nach Agent, nach Art (der getestete Agent, die Bewertung, die Zusammenfassungen) und nach Tag auf. Ein Blick darauf lohnt sich, bevor Sie einen großen Datensatz auf einen häufigen Zeitplan setzen.