Leer los resultados
El boletín de notas, la rejilla caso a caso y la comparación que te dice si un cambio ayudó.
Ejecutar conjunto, elige uno, y evalúa la revisión actual de tu agente contra todos los casos. Puedes ver el progreso y cancelar: los casos que aún no han empezado se omiten, y los que están en marcha terminan primero.
El boletín de notas
El titular es casos aprobados, por ejemplo "14/20 casos aprobados", y un caso aprueba cuando aprueban todas sus comprobaciones bloqueantes. Junto a él puedes ver:
- un recuento de casos incompletos, que no terminaron
- un recuento de casos sin comprobaciones aplicables, que merece investigarse: esos no puntuaron nada
- info, que marca comprobaciones que se siguen pero que nunca hacen fallar un caso
No persigas el 20/20. Un conjunto que siempre saca la nota máxima ha dejado de decirte nada, y normalmente significa que faltan los casos incómodos. Andar por el diecisiete o dieciocho con un grupo estable de fallos conocidos es un sitio más sano.
Casos por evaluadores
Una rejilla: una fila por caso, una columna por comprobación, para que veas de un vistazo si un fallo es un caso malo o una comprobación mala.
Cada celda es Aprobado, Fallado, Omitido, Con error o Sin listón de aprobado (puntuado, pero sin umbral fijado). Abre una celda para ver la puntuación, el umbral contra el que se juzgó y la justificación del juez.
Lee la justificación antes de actuar. A menudo el agente tenía razón y la comprobación estaba mal, que es una señal para arreglar tu criterio y no tu agente.
Los dos patrones que hay que buscar:
Una columna que falla casi entera es un problema de la comprobación, o de algo sistémico. Veinte casos no fallan todos en fidelidad por casualidad.
Una fila que falla casi entera es un caso difícil. Léelo: a veces es de verdad injusto, más a menudo es el interesante.
El resto de una ejecución
Resumen es un comentario escrito sobre cómo fue la ejecución, generado al terminar. Puedes regenerarlo.
Pasos y Llamadas a herramientas muestran lo que hizo realmente el agente en cada caso, que es donde descubres que nunca buscó en la colección.
Artefactos guarda todo lo que produjo.
El identificador de traza es para tus administradores. Si tu organización recoge trazas, ese identificador encuentra el detalle completo.
Comparar dos ejecuciones
El motivo por el que se hace todo esto.
Comparar con y luego elige otra ejecución completada del mismo conjunto. Obtienes:
Diferencias de puntuación por evaluador, la ejecución A contra la B, con la diferencia.
Cambios en la spec entre las dos, porque una ejecución registra qué revisión del agente usó. Así ves que la puntuación se movió y qué cambió: instrucciones editadas, herramientas añadidas o quitadas, temperatura cambiada, colecciones fijadas o desfijadas.
Cambios de puntuación caso a caso, que es donde está el detalle útil. Una media sin cambios puede esconder cuatro casos que mejoran y cuatro que empeoran, y eso suele ser más interesante que la media.
Compara ejecuciones del mismo conjunto. Comparar entre conjuntos distintos no te dice nada, que es por lo que el diálogo solo ofrece ejecuciones del mismo conjunto.
Revisiones
Cada guardado de un agente crea una revisión. La vista de Versiones las lista con un resumen (instrucciones, cuántas herramientas, subagentes, colecciones fijadas) y te deja seleccionar dos y Comparar para ver exactamente qué cambió.
Combina eso con la comparación de ejecuciones y puedes responder a la pregunta para la que existe esta función: ¿lo que cambié el martes lo mejoró?
El panel
Evaluaciones en la columna izquierda muestra la salud de las evaluaciones de todos los agentes a los que tienes acceso, con un filtro para mostrar solo lo que necesita atención.
Las tendencias dibujan una línea de tasa de aprobado sobre las ejecuciones recientes.
Un corte discontinuo en una línea de tendencia marca un cambio de versión de un evaluador. Las puntuaciones a un lado y a otro no son comparables, así que la línea se corta en lugar de unirse.
Es una negativa deliberada a trazar una línea tranquilizadora a través de una discontinuidad. Si ves uno, no leas a través de él.
También puedes ver ejecuciones marcadas como anteriores a un rediseño de la puntuación, cuyos números no son comparables con los de hoy. Las ejecuciones antiguas quedan excluidas de las tendencias en lugar de mezclarse sin avisar.
Qué hacer con un fallo
Lee primero la justificación. ¿Se equivocó el agente o la comprobación?
Comprueba si usó sus herramientas. Una respuesta segura sin búsqueda en la colección es el fallo clásico, y normalmente se arregla en las instrucciones y no en el modelo.
Cambia una sola cosa y vuelve a ejecutar. Cambiar las instrucciones y los casos a la vez significa que no aprendes nada del resultado.
Conserva el caso que falla. En cuanto apruebe, es un caso que ya no puede volver a fallar en silencio.