Asteria Docs
Evaluaciones

Elegir comprobaciones

Los tipos de evaluador, para qué sirve cada uno y cómo un caso acaba aprobando o fallando.

Un evaluador es una comprobación que se aplica a todos los casos. Los eliges en el conjunto y puedes sobrescribirlos caso a caso.

Vienen en cinco grupos, y la distinción útil es barato y seguro frente a caro y de juicio.

Comportamental: barato, determinista

Comprobaciones mecánicas sin ningún modelo de por medio. No cuestan nada y siempre dan la misma respuesta.

  • Tipo de salida correcto: ¿ha vuelto con la forma esperada?
  • Latencia bajo el umbral: ¿fue lo bastante rápido?
  • Herramientas utilizadas: ¿llamó a las herramientas que debía?

Herramientas utilizadas es más útil de lo que parece. Configúralo para comprobar que el agente buscó en tu colección en vez de responder de memoria, y detectas el fallo silencioso más común de todos. Además se invierte: aprueba cuando las herramientas no se usan, que es como compruebas una salvaguarda ("este agente nunca debe enviar correo").

Empieza aquí. Estas comprobaciones son gratis y detectan problemas reales.

Estructurado: ¿es fiel a los documentos?

Para agentes que responden desde una colección. Descomponen la respuesta y la contrastan con el material recuperado.

  • Fidelidad: ¿está toda afirmación respaldada por los documentos, o adornó?
  • Pertinencia de la respuesta: ¿responde de verdad a la pregunta que se hizo?
  • Precisión del contexto y cobertura del contexto: ¿encontró la recuperación el material correcto, y suficiente?

Fidelidad es la que hay que ejecutar en cualquier agente cuyo trabajo sea responder desde tus documentos. Es la comprobación de la invención confiada, que es el fallo que más se teme y que menos se prueba.

Las dos comprobaciones de contexto son diagnósticas: cuando la fidelidad está bien pero las respuestas son flojas, te dicen si el problema es el agente o la colección de debajo.

Heurístico: un juez con una rúbrica

Un modelo puntúa cada respuesta contra una rúbrica general.

  • Completitud: ¿cubrió lo que debía?
  • Seguridad: ¿hay algo problemático?

Rápido y cualitativo. Trata las puntuaciones como una señal más que como una medición: son opiniones, y se mueven un poco entre ejecuciones.

Tarea de datos: ¿salió bien el artefacto?

Para agentes que producen tablas y gráficos, estas comparan lo que salió contra una forma esperada: forma de la tabla, columnas, esquema, valores, tipo de gráfico, más un juez general de calidad del análisis de datos.

Solo son relevantes si tu agente produce artefactos de datos. Ignóralas en el resto de casos.

Personalizado: tu propio criterio

Añadir evaluador personalizado te permite escribir la comprobación tú. Una etiqueta (que se convierte en el encabezado de columna en los resultados) y un criterio en lenguaje llano.

El criterio es donde está el trabajo. Los criterios vagos producen puntuaciones sin sentido:

Flojo: La respuesta es de buena calidad.

Fuerte: Usa nuestra terminología de casa: "miembro" y no "usuario", "plan" y no "paquete". Nunca promete un plazo concreto. Termina con un siguiente paso que el lector pueda dar.

El diálogo sugiere anclar la escala, y merece la pena hacerlo. Tomando el mismo criterio y diciendo cómo son los extremos:

Anclado: 0 = usa "usuario" o "paquete", o promete un plazo. 1 = usa "miembro" y "plan" en todo el texto, no promete plazos y termina con un siguiente paso.

Un juez al que le dices cómo son el 0 y el 1 es mucho más consistente que uno al que dejas interpretar "bueno".

Añade tantos como necesites, cada uno con una etiqueta distinta.

Cómo aprueba o falla un caso

Merece entenderse, porque el número de titular depende de ello.

Cada comprobación produce una puntuación de 0 a 1, y algunas tienen un umbral: si la puntuación llega a él o lo supera, la comprobación aprueba. Una comprobación sin umbral se puntúa y se muestra pero no tiene listón de aprobado, y los resultados lo indican en lugar de fingir.

Un caso aprueba cuando aprueban todas sus comprobaciones bloqueantes. Las comprobaciones omitidas o con error no cuentan en su contra.

Bloqueante es la palabra importante. Una comprobación se puede marcar como informativa: se puntúa, se muestra y se sigue a lo largo del tiempo, pero nunca hace fallar un caso. Usa eso para cosas que quieres vigilar sin que bloqueen, como un juez estilístico cuya opinión no quieres que decida si una ejecución sale en verde.

Las repeticiones, si ejecutas un caso más de una vez, toman la puntuación media, y el caso aprueba solo si aprueban todas las repeticiones. Es deliberado: una respuesta que aprueba dos de cada tres veces no es una respuesta aprobada, es una respuesta intermitente, y lo intermitente es señal y no ruido.

Elegir un conjunto sensato

Para la mayoría de agentes, empieza con:

  1. Herramientas utilizadas, para confirmar que busca en lugar de adivinar
  2. Fidelidad, si responde desde documentos
  3. Un juez personalizado para lo que sea que signifique "correcto" en tu trabajo

Tres comprobaciones que entiendes ganan a nueve que no. Sabes qué significa un fallo, que es de lo que se trata.

Añade más cuando un fallo real se cuele entre las que tienes, y usa informativa en lugar de bloqueante para cualquier cosa de la que aún no te fíes.

Cada comprobación basada en un modelo (estructurada, heurística, personalizada y el juez de análisis de datos) cuesta una llamada al modelo por caso, además de ejecutar el propio agente. Veinte casos con cuatro jueces son ochenta llamadas de juez por ejecución.

La vista de Coste desglosa el gasto de evaluación por agente, por tipo (el agente bajo prueba, la puntuación, los resúmenes) y por día. Merece un vistazo antes de poner un conjunto grande en una programación frecuente.

On this page