Lire les résultats
Le tableau de résultats, la grille cas par cas, et la comparaison qui vous dit si une modification a aidé.
Lancer le dataset, choisissez-en un, et il note la révision actuelle de votre agent sur chaque cas. Vous pouvez suivre la progression et annuler : les cas non commencés sont ignorés, et les cas en cours se terminent d'abord.
Le tableau de résultats
Le chiffre en tête, ce sont les cas réussis, par exemple « 14/20 cas réussis », et un cas réussit quand toutes ses vérifications bloquantes réussissent. À côté, vous pouvez voir :
- un décompte de cas incomplets, qui ne sont pas allés au bout
- un décompte de cas sans vérification applicable, à examiner de près : ceux-là n'ont été notés sur rien du tout
- info, qui marque les vérifications suivies mais qui ne font jamais échouer un cas
Ne courez pas après le 20/20. Un dataset qui obtient toujours la note maximale a cessé de vous apprendre quoi que ce soit, et cela veut généralement dire qu'il manque les cas délicats. Quelque part au-dessus de 15 sur 20, avec un ensemble stable d'échecs connus, est un endroit plus sain.
Cas × évaluateurs
Une grille : une ligne par cas, une colonne par vérification, pour voir d'un coup d'œil si un échec vient d'un mauvais cas ou d'une mauvaise vérification.
Chaque cellule est Réussi, Échec, Ignoré, Erreur, ou Sans seuil (noté, mais sans seuil défini). Ouvrez une cellule pour voir le score, le seuil auquel il a été comparé, et la Justification du juge.
Lisez la justification avant d'agir. Souvent l'agent avait raison et c'est la vérification qui avait tort, ce qui indique qu'il faut corriger votre critère plutôt que votre agent.
Les deux motifs à repérer :
Une colonne majoritairement en échec signale un problème avec la vérification, ou quelque chose de systémique. Vingt cas n'échouent pas tous à la fidélité par hasard.
Une ligne majoritairement en échec signale un cas difficile. Lisez-le : parfois il est réellement injuste, plus souvent c'est le cas intéressant.
Le reste d'une exécution
Synthèse est un commentaire rédigé sur le déroulement de l'exécution, généré à la fin. Vous pouvez le régénérer.
Étapes et Appels d'outils montrent ce que l'agent a réellement fait sur chaque cas, et c'est là que vous découvrez qu'il n'a jamais cherché dans la collection.
Artefacts contient tout ce qu'il a produit.
ID de trace est destiné à vos administrateurs. Si votre organisation collecte les traces, cet identifiant permet de retrouver le détail complet.
Comparer deux exécutions
La raison de faire tout ça.
Comparer avec…, puis choisissez une autre exécution terminée du même dataset. Vous obtenez :
Écarts de scores par évaluateur, exécution A contre exécution B, avec la différence.
Changements de spec entre les deux, puisqu'une exécution enregistre quelle révision de l'agent elle a utilisée. Vous voyez donc que le score a bougé et ce qui a changé : instructions modifiées, outils ajoutés ou retirés, température changée, collections épinglées ou désépinglées.
Écarts de scores par cas, et c'est là que se trouve le détail utile. Une moyenne inchangée peut cacher quatre cas qui s'améliorent et quatre qui se dégradent, et c'est généralement plus intéressant que la moyenne.
Comparez des exécutions du même dataset. Comparer d'un dataset à l'autre ne vous apprend rien, et c'est pourquoi la boîte de dialogue ne propose que les exécutions du même dataset.
Les révisions
Chaque enregistrement d'un agent crée une révision. La vue Versions les liste avec un résumé (instructions, nombre d'outils, sous-agents, collections épinglées) et vous permet d'en sélectionner deux et de les Comparer pour voir exactement ce qui a changé.
Associez ça à la comparaison d'exécutions et vous pouvez répondre à la question pour laquelle cette fonctionnalité existe : est-ce que ce que j'ai changé mardi l'a rendu meilleur ?
Le tableau de bord
Évaluations dans la barre latérale montre l'état des évaluations de tous les agents auxquels vous avez accès, avec Afficher uniquement ce qui nécessite votre attention.
Les tendances tracent une courbe du taux de réussite sur les exécutions récentes.
Une rupture en pointillés dans une courbe de tendance marque un changement de version d'évaluateur. Les scores de part et d'autre ne sont pas comparables, donc la courbe est coupée plutôt que reliée.
C'est un refus délibéré de tracer une jolie ligne rassurante à travers une discontinuité. Si vous en voyez une, ne lisez pas au travers.
Vous pouvez aussi voir des exécutions marquées comme antérieures à une refonte du scoring, dont les chiffres ne sont pas comparables avec ceux d'aujourd'hui. Les exécutions plus anciennes sont exclues des tendances plutôt que mélangées en silence.
Que faire d'un échec
Lisez d'abord la justification. Est-ce l'agent qui avait tort, ou la vérification ?
Vérifiez s'il a utilisé ses outils. Une réponse assurée sans aucune recherche dans la collection est l'échec classique, et il se corrige généralement dans les instructions plutôt que dans le modèle.
Changez une seule chose, puis relancez. Modifier les instructions et les cas ensemble, c'est ne rien apprendre du résultat.
Gardez le cas en échec. Une fois qu'il passe, c'est un cas qui ne pourra plus jamais régresser en silence.