Tutorial: evaluar un agente
Coge un agente que ya tengas, averigua si funciona y demuestra que tu siguiente cambio ayudó.
Vamos a evaluar un agente que responde preguntas desde una colección: un asistente de políticas de RR. HH., unas FAQ de producto, cualquier cosa con esa forma. Usa uno que ya tengas.
El objetivo no es una puntuación perfecta. Es una ejecución contra la que puedas comparar después de tu siguiente edición.
Empieza un conjunto
Abre el agente, ve a Evaluaciones y luego Nuevo conjunto.
Nombre: Preguntas del día a día
Descripción: Las preguntas que la gente hace de verdad, más las que debería declinar. Ejecutar antes de publicar un cambio.
Escribe ocho casos normales
Preguntas reales, escritas como las escribiría un compañero, con erratas y todo.
¿Cuántos días de vacaciones tengo?
cual es el proceso para pasar a gastos un billete de tren
Deja la Salida esperada vacía por ahora. La mayoría de comprobaciones no la necesitan, y escribir ocho respuestas de referencia es una hora que aún no tienes que gastar.
Escribe cuatro casos que debería declinar
El grupo que todo el mundo se salta, y donde los agentes fallan de verdad.
Preguntas fuera de su ámbito, y preguntas que los documentos genuinamente no responden:
¿Puedes aprobar mi solicitud de vacaciones?
¿Cuál es la política sobre excedencias? (cuando no hay ninguna)
Para estas, usa la Salida esperada para dejar por escrito cómo es un buen resultado:
Dice que los documentos no cubren las excedencias y sugiere preguntar a RR. HH. No se inventa una política.
Este es el grupo que caza la invención confiada, que es el fallo del que más quieres enterarte.
Añade dos trampas
Preguntas con una premisa falsa:
¿Por qué recortamos el presupuesto de formación este año? (cuando no se recortó)
Un buen agente cuestiona la premisa. Uno malo explica tu decisión imaginaria, con toda soltura.
Elige tres comprobaciones
Evaluadores en el conjunto. Resiste la tentación de añadirlo todo.
Herramientas utilizadas, apuntando a la herramienta de búsqueda en la colección. Confirma que consultó en lugar de responder de memoria. Gratis y determinista.
Fidelidad. Comprueba que toda afirmación está respaldada por los documentos que recuperó. Este es el detector de invenciones.
Un juez personalizado. Añadir evaluador personalizado:
- Etiqueta:
Admite no saber - Criterio:
0 = afirma una política o una cifra que los documentos no respaldan. 1 = cuando los documentos no responden a la pregunta, lo dice claramente y sugiere a quién preguntar. Las respuestas plenamente respaldadas por los documentos también puntúan 1.
Anclar el 0 y el 1 explícitamente es lo que hace consistente a un juez.
Ejecútalo
Ejecutar conjunto, elígelo y observa. Catorce casos con tres comprobaciones tardan unos minutos.
Léelo como es debido
Probablemente saques algo como 9/14. Ese es un primer resultado normal y útil.
Abre la rejilla de casos por evaluadores:
Escanea primero las columnas. Una columna que falla casi entera es un problema de comprobación o algo sistémico. Si Herramientas utilizadas falla ampliamente, tu agente no está buscando, y esa es la cosa más importante que aprenderás hoy.
Luego las filas. Tus casos de rechazo y tus trampas son los interesantes. Abre los fallos y lee la justificación del juez.
Comprueba que la justificación es justa. A veces el agente tenía razón y tu criterio estaba mal. Arregla el criterio, y anota que por esto se escriben los criterios antes de fiarse de las puntuaciones.
Cambia exactamente una cosa
Supón que fallaron las trampas y explicó un recorte de presupuesto que nunca ocurrió. Edita las instrucciones del agente:
Si una pregunta da por hecho algo que no puedes verificar en los
documentos, dilo antes de responder. No aceptes la premisa de una
pregunta como un hecho solo porque se haya afirmado.
Si los documentos no cubren algo, dilo claramente y sugiere a quién
preguntar. Nunca rellenes el hueco con una respuesta que suene
plausible.Guarda. Eso crea una revisión nueva.
No cambies nada más. Ni los casos ni las comprobaciones. Una sola variable.
Ejecuta otra vez y compara
Ejecuta el mismo conjunto. Luego abre la ejecución nueva y usa Comparar con apuntando a la primera.
Obtienes diferencias de puntuación por comprobación, los cambios en la spec entre las dos revisiones (tu edición de instrucciones) y los cambios de puntuación caso a caso.
Este último es el que hay que leer. Una media que apenas se movió puede esconder tres casos arreglados y dos rotos, y los que rompiste son los que necesitas ver.
Conviértelo en un hábito
Ya tienes una línea base. A partir de aquí:
Vuelve a ejecutar antes de publicar cualquier cambio, sobre todo en un agente compartido.
Añade cada fallo real como caso. Alguien reporta una mala respuesta, y se convierte en el caso quince. En dos meses esta es la parte más valiosa del conjunto.
No persigas el 14/14. Un conjunto que siempre aprueba ha dejado de hacer su trabajo. Una puntuación estable con fallos conocidos y entendidos es más sana que una perfecta.
Si te atascas
Todo aprueba en la primera ejecución. Tus casos son demasiado fáciles. Añade rechazos y trampas más duros.
Todo falla. Normalmente es una comprobación mal configurada. Abre una celda y lee la justificación antes de tocar el agente.
Las puntuaciones bailan entre ejecuciones idénticas. Los jueces basados en modelos no son perfectamente repetibles. Mira las tendencias a lo largo de varias ejecuciones, no un punto suelto, y usa repeticiones para un caso cuyo resultado dudes: toma la media y solo aprueba si aprueban todas las repeticiones.
Está costando más de lo que esperabas. Cada comprobación basada en un modelo es una llamada por caso. Recorta comprobaciones, o ejecuta el conjunto con menos frecuencia. La vista de Coste muestra a dónde se fue.
Siguiente
- Elegir comprobaciones para el catálogo completo.
- Construir un conjunto sobre generar casos y publicar un conjunto para tu equipo.
- Leer los resultados para el panel de todos tus agentes.