Asteria Docs
Evaluierungen

Tutorial: einen Agenten evaluieren

Nehmen Sie einen Agenten, den Sie schon haben, finden Sie heraus, ob er funktioniert, und beweisen Sie, dass Ihre nächste Änderung geholfen hat.

Wir evaluieren einen Agenten, der Fragen aus einer Sammlung beantwortet: einen HR-Richtlinien-Assistenten, eine Produkt-FAQ, irgendetwas dieser Art. Nehmen Sie einen, den Sie schon haben.

Das Ziel ist keine perfekte Punktzahl. Das Ziel ist ein Lauf, gegen den Sie nach Ihrer nächsten Änderung vergleichen können.

Einen Datensatz beginnen

Öffnen Sie den Agenten, gehen Sie auf Evaluierungen, dann Neuer Datensatz.

Name: Everyday questions

Beschreibung: Die Fragen, die tatsächlich gestellt werden, plus die, die er ablehnen sollte. Vor jeder Veröffentlichung einer Änderung ausführen.

Acht gewöhnliche Fälle schreiben

Echte Fragen, getippt so, wie eine Kollegin sie tippen würde, samt Tippfehlern.

Wie viele Urlaubstage bekomme ich?

wie laeuft das mit der abrechnung von einem zugticket

Lassen Sie Erwartete Ausgabe vorerst leer. Die meisten Prüfungen brauchen keine, und acht Referenzantworten zu schreiben ist eine Stunde, die Sie sich jetzt noch sparen können.

Vier Fälle schreiben, die er ablehnen sollte

Die Gruppe, die alle überspringen, und genau die, an der Agenten wirklich scheitern.

Fragen außerhalb seines Auftrags, und Fragen, auf die die Dokumente wirklich keine Antwort geben:

Kannst du meinen Urlaubsantrag genehmigen?

Wie ist die Regelung für ein Sabbatical? (wenn es keine gibt)

Nutzen Sie hier Erwartete Ausgabe, um festzuhalten, wie gut aussieht:

Sagt, dass die Dokumente Sabbaticals nicht abdecken, und schlägt vor, die Personalabteilung zu fragen. Erfindet keine Regelung.

Das ist die Gruppe, die selbstsicheres Erfinden abfängt, also den Fehlschlag, von dem Sie am ehesten erfahren wollen.

Zwei Fallen hinzufügen

Fragen mit einer falschen Prämisse:

Warum haben wir dieses Jahr das Weiterbildungsbudget gekürzt? (wenn es nicht gekürzt wurde)

Ein guter Agent hinterfragt die Prämisse. Ein schlechter erklärt Ihnen flüssig Ihre eingebildete Entscheidung.

Drei Prüfungen wählen

Evaluierer am Datensatz. Widerstehen Sie dem Drang, alles hinzuzufügen.

Tools genutzt, eingestellt auf das Suchwerkzeug für die Sammlung. Bestätigt, dass er nachgeschlagen hat, statt aus dem Gedächtnis zu antworten. Kostenlos und deterministisch.

Faithfulness. Prüft, dass jede Aussage durch die Dokumente gedeckt ist, die er gefunden hat. Das ist der Erfindungsmelder.

Ein eigener Juror. Eigenen Evaluierer hinzufügen:

  • Bezeichnung: Gibt Unwissen zu
  • Kriterium: 0 = nennt eine Regelung oder eine Zahl, die die Dokumente nicht stützen. 1 = wenn die Dokumente die Frage nicht beantworten, sagt er das klar und schlägt vor, wen man fragen kann. Antworten, die vollständig durch die Dokumente gedeckt sind, bekommen ebenfalls 1.

Dass Sie 0 und 1 ausdrücklich verankern, ist das, was einen Juror einheitlich macht.

Ausführen

Datensatz ausführen, wählen Sie ihn aus, und sehen Sie zu. Vierzehn Fälle mit drei Prüfungen dauern ein paar Minuten.

Richtig lesen

Sie bekommen wahrscheinlich so etwas wie 9/14. Das ist ein normales und nützliches erstes Ergebnis.

Öffnen Sie das Raster Fälle × Evaluatoren:

Schauen Sie zuerst die Spalten an. Eine überwiegend fehlschlagende Spalte ist ein Problem der Prüfung oder etwas Systematisches. Wenn Tools genutzt breit durchfällt, sucht Ihr Agent nicht, und das ist die größte Erkenntnis, die Sie heute mitnehmen.

Dann die Zeilen. Ihre Ablehnungsfälle und die Fallen sind die interessanten. Öffnen Sie die Fehlschläge und lesen Sie die Begründung des Jurors.

Prüfen Sie, ob die Begründung fair ist. Manchmal hatte der Agent recht und Ihr Kriterium unrecht. Reparieren Sie das Kriterium, und merken Sie sich: genau deshalb schreibt man Kriterien, bevor man Punktzahlen vertraut.

Genau eine Sache ändern

Sagen wir, die Fallen sind fehlgeschlagen und er hat eine Budgetkürzung erklärt, die es nie gab. Bearbeiten Sie die Anweisungen des Agenten:

Wenn eine Frage etwas voraussetzt, das du in den Dokumenten nicht prüfen
kannst, sag das, bevor du antwortest. Übernimm die Annahme einer Frage
nicht als Tatsache, nur weil sie behauptet wurde.

Wenn die Dokumente etwas nicht abdecken, sag das klar und schlage vor,
wen man fragen kann. Fülle die Lücke nie mit einer plausibel klingenden
Antwort.

Speichern. Das erzeugt eine neue Revision.

Ändern Sie sonst nichts. Nicht die Fälle, nicht die Prüfungen. Eine Variable.

Erneut ausführen und vergleichen

Führen Sie denselben Datensatz aus. Öffnen Sie dann den neuen Lauf und wählen Sie Vergleichen mit… den ersten.

Sie bekommen Score-Differenzen pro Prüfung, die Spec-Änderungen zwischen den beiden Revisionen (Ihre Änderung an den Anweisungen) und Score-Änderungen pro Fall.

Das Letzte ist das, was Sie lesen sollten. Ein Durchschnitt, der sich kaum bewegt hat, kann drei reparierte und zwei kaputtgemachte Fälle verstecken, und die kaputtgemachten sind die, die Sie sehen müssen.

Eine Gewohnheit daraus machen

Sie haben jetzt eine Ausgangsbasis. Von hier aus:

Führen Sie vor jeder Veröffentlichung einer Änderung erneut aus, besonders bei einem geteilten Agenten.

Nehmen Sie jeden echten Fehlschlag als Fall auf. Jemand meldet eine schlechte Antwort, sie wird Fall fünfzehn. Innerhalb von zwei Monaten ist das der wertvollste Teil des Datensatzes.

Jagen Sie nicht der 14/14 hinterher. Ein Datensatz, der immer besteht, tut seine Arbeit nicht mehr. Eine stabile Punktzahl mit bekannten, verstandenen Fehlschlägen ist gesünder als eine perfekte.

Wenn Sie feststecken

Beim ersten Lauf besteht alles. Ihre Fälle sind zu leicht. Ergänzen Sie schwerere Ablehnungen und Fallen.

Alles fällt durch. Meist eine einzige falsch eingestellte Prüfung. Öffnen Sie eine Zelle und lesen Sie die Begründung, bevor Sie den Agenten anfassen.

Die Punktzahlen schwanken zwischen identischen Läufen. Modellbasierte Juroren sind nicht perfekt wiederholbar. Schauen Sie auf Trends über mehrere Läufe statt auf einen einzelnen Punkt, und nutzen Sie Wiederholungen für einen Fall, an dessen Ergebnis Sie zweifeln: es wird der Mittelwert genommen, und er besteht nur, wenn jede Wiederholung besteht.

Es kostet mehr, als Sie erwartet haben. Jede modellbasierte Prüfung ist ein Aufruf pro Fall. Kürzen Sie die Prüfungen, oder lassen Sie den Datensatz seltener laufen. Die Ansicht Kosten zeigt, wohin es gegangen ist.

Weiter

On this page