Leggere i risultati
La pagella, la griglia caso per caso e il confronto che ti dice se una modifica ha aiutato.
Esegui dataset, scegline uno, e valuta la revisione attuale del tuo agente su ogni caso. Puoi guardare l'avanzamento e annullare: i casi non ancora iniziati vengono saltati, e quelli in corso finiscono prima.
La pagella
Il numero in cima è Casi superati, per esempio "14/20 casi superati", e un caso è superato quando tutti i suoi controlli vincolanti sono superati. Accanto potresti vedere:
- un conteggio dei casi incompleti, che non sono arrivati in fondo
- un conteggio dei casi senza controlli applicabili, da approfondire: quelli non hanno ottenuto nessun punteggio
- info, che contrassegna i controlli seguiti ma che non fanno mai fallire un caso
Non rincorrere il 20/20. Un dataset che fa sempre il punteggio pieno ha smesso di dirti qualcosa, e di solito significa che mancano i casi scomodi. Stare intorno al diciassette o diciotto con un insieme stabile di fallimenti noti è una posizione più sana.
Casi × valutatori
Una griglia: una riga per caso, una colonna per controllo, così vedi a colpo d'occhio se un fallimento è un caso brutto oppure un controllo brutto.
Ogni cella è Superato, Fallito, Saltato, Errore oppure Nessuna soglia (valutato, ma senza soglia impostata). Apri una cella per vedere il punteggio, la soglia rispetto a cui è stato giudicato e la Motivazione del giudice.
Leggi la motivazione prima di agire. Spesso l'agente aveva ragione e il controllo aveva torto, che è il segnale per sistemare il criterio invece dell'agente.
I due schemi da cercare:
Una colonna che fallisce quasi sempre è un problema del controllo, o di qualcosa di sistemico. Venti casi non falliscono tutti la fedeltà per coincidenza.
Una riga che fallisce quasi sempre è un caso difficile. Leggilo: a volte è davvero ingiusto, più spesso è quello interessante.
Il resto di un'esecuzione
Sintesi è un commento scritto su come è andata l'esecuzione, generato al termine. Puoi rigenerarlo.
Passaggi e Chiamate strumenti mostrano cosa ha fatto davvero l'agente per ogni caso, ed è lì che scopri che non ha mai cercato nella raccolta.
Artefatti contiene tutto ciò che ha prodotto.
Trace ID serve ai tuoi amministratori. Se la tua organizzazione raccoglie le tracce, quell'id trova il dettaglio completo.
Confrontare due esecuzioni
Il motivo per cui si fa tutto questo.
Confronta con…, poi scegli un'altra esecuzione completata dello stesso dataset. Ottieni:
Variazioni punteggi per valutatore, Esecuzione A contro Esecuzione B, con la differenza.
Modifiche specifica tra le due, dato che un'esecuzione registra quale Revisione dell'agente ha usato. Così vedi che il punteggio si è mosso e cosa è cambiato: istruzioni modificate, strumenti aggiunti o tolti, temperatura cambiata, raccolte fissate o sfissate.
Variazioni punteggio per caso, che è dove sta il dettaglio utile. Una media invariata può nascondere quattro casi migliorati e quattro peggiorati, e di solito è più interessante della media.
Confronta esecuzioni dello stesso dataset. Confrontare tra dataset diversi non ti dice niente, ed è per questo che la finestra offre solo esecuzioni dello stesso dataset.
Revisioni
Ogni salvataggio di un agente crea una revisione. La vista Revisioni le elenca con un riepilogo (istruzioni, quanti strumenti, sotto-agenti, raccolte fissate) e ti permette di sceglierne due e premere Confronta per vedere esattamente cosa è cambiato.
Abbina quello al confronto tra esecuzioni e puoi rispondere alla domanda per cui questa funzione esiste: la cosa che ho cambiato martedì l'ha migliorato?
La dashboard
Valutazioni nella colonna sinistra mostra lo stato delle valutazioni di tutti gli agenti a cui hai accesso, con Mostra solo ciò che richiede attenzione.
Gli andamenti tracciano una linea del tasso di successo sulle esecuzioni recenti.
Un'interruzione tratteggiata in una linea di andamento segnala un cambio di versione del valutatore. I punteggi ai due lati non sono confrontabili, quindi la linea viene interrotta anziché unita.
È un rifiuto deliberato di tracciare una linea rassicurante attraverso una discontinuità. Se ne vedi una, non leggerci attraverso.
Potresti vedere anche esecuzioni contrassegnate come precedenti a una revisione del punteggio, i cui numeri non sono confrontabili con quelli di oggi. Le esecuzioni più vecchie sono escluse dagli andamenti invece di essere mescolate in silenzio.
Cosa fare con un fallimento
Leggi prima la motivazione. Aveva torto l'agente, o il controllo?
Controlla se ha usato i suoi strumenti. Una risposta sicura di sé senza nessuna ricerca nella raccolta è il fallimento classico, e di solito si risolve nelle istruzioni più che nel modello.
Cambia una cosa sola, poi riesegui. Cambiare istruzioni e casi insieme significa non imparare niente dal risultato.
Tieni il caso fallito. Una volta che passa, è un caso che non può più regredire in silenzio.