Asteria Docs
Évaluations

Évaluations

Comment savoir si votre agent est bon, et si votre dernière modification a vraiment aidé.

Vous avez créé un agent. Vous l'avez essayé deux ou trois fois, ça semblait bien, vous l'avez partagé.

Puis vous avez amélioré ses instructions. Est-il meilleur maintenant ? Vous l'essayez deux fois, ça semble bien. Mais vous n'avez pas repassé les cas délicats de la semaine dernière, et vous ne vous rappelez plus exactement ce qu'il répondait avant.

Une évaluation, c'est cette vérification, écrite noir sur blanc pour pouvoir être refaite à l'identique.

Ce que c'est vraiment

Trois choses :

Des cas. Des questions que vous poseriez à l'agent, avec vos notes sur ce à quoi ressemble une bonne réponse. Une vingtaine, disons.

Des vérifications. Ce que « bon » veut dire, rendu explicite. Est-il resté dans le sujet ? S'en est-il tenu aux documents plutôt que d'inventer ? A-t-il utilisé le bon outil ? A-t-il répondu assez vite ?

Une exécution. Asteria pose chaque cas à votre agent et applique chaque vérification, puis vous affiche un tableau de résultats.

Modifiez l'agent, relancez, comparez. C'est toute l'idée, le reste n'est que du détail.

Pourquoi ça vaut un après-midi

Vous ne vous souvenez pas de ce qu'il faisait avant. Personne ne s'en souvient. Une exécution d'il y a trois semaines, si.

Une correction ici casse quelque chose ailleurs. Vous ajoutez « cite toujours la source » et il se met à refuser des questions auxquelles il répondait très bien. Vingt cas repèrent ça en cinq minutes.

« Ça a l'air mieux » n'est pas une raison de publier. Surtout quand vous êtes sur le point de publier l'agent à toute votre organisation.

Un jour, vous hériterez d'un agent. Son évaluation est la seule description honnête de ce qu'il est censé faire.

Quand s'en donner la peine

Pas pour chaque agent. Un agent que vous avez créé pour vous, que vous utilisez deux fois par semaine et que vous pouvez juger à l'œil nu s'en passe très bien. L'effort ne devient rentable que lorsque se tromper a un coût ou un public.

Ça en vaut la peine quand :

  • L'agent est partagé, donc quelqu'un d'autre compte sur sa justesse
  • Il touche à quelque chose de conséquent : des chiffres, une politique interne, tout ce qui est vu par des clients
  • Vous le modifiez régulièrement et voulez savoir si vous l'améliorez
  • Il tourne sans surveillance sur une planification, et personne ne voit une mauvaise réponse avant longtemps

Le vocabulaire

MotSignification
DatasetUn ensemble de cas, plus les vérifications à leur appliquer
CasUne question, éventuellement accompagnée d'une réponse de référence
ÉvaluateurUne vérification, appliquée à chaque cas
ExécutionLe passage complet d'un dataset sur l'agent
RévisionUne version enregistrée de la configuration de l'agent, créée à chaque enregistrement
ModèleUn dataset publié par un collègue ou fourni avec le produit, prêt à copier

Où ça se trouve

À deux endroits, pour deux usages différents.

Sur l'agent, une section Évaluations : construire des datasets, les lancer, lire les résultats de cet agent.

Évaluations dans la barre latérale de la zone Agents, un tableau de bord sur tous les agents que vous pouvez voir, avec un filtre Afficher uniquement ce qui nécessite votre attention. Utile dès que vous en avez plus de deux ou trois.

La suite

On this page