Tutoriel : évaluer un agent
Prenez un agent que vous avez déjà, découvrez s'il fonctionne, et prouvez que votre prochaine modification a aidé.
Nous allons évaluer un agent qui répond à des questions à partir d'une collection : un assistant sur les politiques RH, une FAQ produit, n'importe quoi de cette forme. Prenez-en un que vous avez déjà.
L'objectif n'est pas un score parfait. C'est d'obtenir une exécution à laquelle vous pourrez comparer après votre prochaine modification.
Créez un dataset
Ouvrez l'agent, allez dans Évaluations, puis Nouveau dataset.
Nom : Questions du quotidien
Description : Les questions que les gens posent vraiment, plus celles auxquelles il doit refuser de répondre. À lancer avant de publier une modification.
Écrivez huit cas ordinaires
De vraies questions, tapées comme un collègue les taperait, fautes de frappe comprises.
J'ai droit à combien de jours de congés ?
cest quoi la procedure pour se faire rembourser un billet de train
Laissez Sortie attendue vide pour l'instant. La plupart des vérifications n'en ont pas besoin, et écrire huit réponses de référence, c'est une heure que vous n'avez pas encore à y passer.
Écrivez quatre cas qu'il devrait décliner
Le groupe que tout le monde saute, et là où les agents échouent vraiment.
Des questions hors de son périmètre, et des questions auxquelles les documents ne répondent réellement pas :
Peux-tu approuver ma demande de congés ?
Quelle est la politique sur les congés sabbatiques ? (alors qu'il n'y en a pas)
Pour ceux-là, utilisez Sortie attendue pour noter ce à quoi ressemble une bonne réponse :
Dit que les documents ne traitent pas des congés sabbatiques, et suggère de demander aux RH. N'invente aucune politique.
C'est le groupe qui attrape l'invention assurée, la panne que vous voulez le plus connaître.
Ajoutez deux pièges
Des questions qui partent d'une fausse prémisse :
Pourquoi avons-nous réduit le budget formation cette année ? (alors qu'il n'a pas été réduit)
Un bon agent interroge la prémisse. Un mauvais explique votre décision imaginaire, avec aisance.
Choisissez trois vérifications
Évaluateurs sur le dataset. Résistez à l'envie de tout ajouter.
Outils utilisés, réglé sur l'outil de recherche dans la collection. Confirme qu'il est allé chercher au lieu de répondre de mémoire. Gratuit et déterministe.
Fidélité. Vérifie que chaque affirmation est étayée par les documents qu'il a retrouvés. C'est le détecteur d'invention.
Un juge personnalisé. Ajouter un évaluateur personnalisé :
- Libellé :
Reconnaît ne pas savoir - Critère :
0 = énonce une règle ou un chiffre que les documents n'étayent pas. 1 = quand les documents ne répondent pas à la question, le dit clairement et suggère à qui s'adresser. Les réponses entièrement étayées par les documents obtiennent aussi 1.
Ancrer explicitement le 0 et le 1, c'est ce qui rend un juge constant.
Lancez-le
Lancer le dataset, choisissez-le, et regardez. Quatorze cas avec trois vérifications, cela prend quelques minutes.
Lisez le résultat correctement
Vous obtiendrez probablement quelque chose comme 9/14. C'est un premier résultat normal et utile.
Ouvrez la grille Cas × évaluateurs :
Balayez les colonnes d'abord. Une colonne majoritairement en échec, c'est un problème de vérification ou quelque chose de systémique. Si Outils utilisés échoue largement, votre agent ne cherche pas, et c'est la plus grande chose que vous apprendrez aujourd'hui.
Puis les lignes. Vos cas de refus et vos pièges sont les plus intéressants. Ouvrez les échecs et lisez la justification du juge.
Vérifiez que la justification est juste. Parfois l'agent avait raison et c'est votre critère qui avait tort. Corrigez le critère, et notez que c'est bien pour ça qu'on écrit les critères avant de faire confiance aux scores.
Changez exactement une chose
Disons que les pièges ont échoué et qu'il a expliqué une réduction de budget qui n'a jamais eu lieu. Modifiez les instructions de l'agent :
If a question assumes something you cannot verify in the documents,
say so before answering. Do not accept the premise of a question as
fact just because it was asserted.
If the documents do not cover something, say that plainly and suggest
who to ask. Never fill the gap with a plausible-sounding answer.Enregistrez. Cela crée une nouvelle révision.
Ne changez rien d'autre. Ni les cas, ni les vérifications. Une seule variable.
Relancez et comparez
Lancez le même dataset. Puis ouvrez la nouvelle exécution et faites Comparer avec… la première.
Vous obtenez les Écarts de scores par vérification, les Changements de spec entre les deux révisions (votre modification d'instructions), et les Écarts de scores par cas.
C'est ce dernier qu'il faut lire. Une moyenne qui a à peine bougé peut cacher trois cas réparés et deux cassés, et ceux que vous avez cassés sont exactement ce que vous devez voir.
Faites-en une habitude
Vous avez maintenant une référence. À partir de là :
Relancez avant de publier la moindre modification, surtout sur un agent partagé.
Ajoutez chaque échec réel comme cas. Quelqu'un signale une mauvaise réponse, elle devient le cas numéro quinze. En deux mois, c'est la partie la plus précieuse du dataset.
Ne courez pas après le 14/14. Un dataset qui passe toujours a cessé de faire son travail. Un score stable avec des échecs connus et compris est plus sain qu'un score parfait.
Si vous bloquez
Tout passe dès la première exécution. Vos cas sont trop faciles. Ajoutez des refus et des pièges plus difficiles.
Tout échoue. En général, c'est une vérification mal configurée. Ouvrez une cellule et lisez la justification avant de toucher à l'agent.
Les scores oscillent entre deux exécutions identiques. Les juges à base de modèle ne sont pas parfaitement reproductibles. Regardez les tendances sur plusieurs exécutions, pas un point isolé, et utilisez les répétitions pour un cas dont le résultat vous laisse un doute : elles prennent la moyenne et ne réussissent que si chaque répétition réussit.
Ça coûte plus cher que prévu. Chaque vérification à base de modèle est un appel par cas. Réduisez les vérifications, ou lancez le dataset moins souvent. La vue Coût montre où c'est parti.
La suite
- Choisir les vérifications pour le catalogue complet.
- Construire un dataset sur la génération de cas et la publication d'un dataset pour votre équipe.
- Lire les résultats pour le tableau de bord sur tous vos agents.