Tutorial: valutare un agente
Prendi un agente che hai già, scopri se funziona e dimostra che la tua prossima modifica ha aiutato.
Valuteremo un agente che risponde a domande partendo da una raccolta: un assistente per le politiche HR, una FAQ di prodotto, qualcosa di quella forma. Usane uno che hai già.
L'obiettivo non è un punteggio perfetto. È un'esecuzione con cui confrontarti dopo la tua prossima modifica.
Avvia un dataset
Apri l'agente, vai su Valutazioni, poi Nuovo dataset.
Nome: Domande di tutti i giorni
Descrizione: Le domande che le persone fanno davvero, più quelle che dovrebbe rifiutare. Da eseguire prima di pubblicare una modifica.
Scrivi otto casi ordinari
Domande vere, scritte come le scriverebbe un collega, refusi compresi.
Quanti giorni di ferie mi spettano?
qual è la procedura per farsi rimborsare un biglietto del treno
Per ora lascia vuoto l'Output atteso. La maggior parte dei controlli non ne ha bisogno, e scrivere otto risposte di riferimento è un'ora che per adesso non devi spendere.
Scrivi quattro casi che dovrebbe rifiutare
Il gruppo che tutti saltano, e dove gli agenti falliscono davvero.
Domande fuori dalla sua competenza, e domande a cui i documenti proprio non rispondono:
Puoi approvare la mia richiesta di ferie?
Qual è la politica sui periodi sabbatici? (quando non ce n'è una)
Per queste, usa l'Output atteso per registrare com'è fatta una buona risposta:
Dice che i documenti non coprono i periodi sabbatici e suggerisce di chiedere alle Risorse Umane. Non si inventa una politica.
È il gruppo che cattura l'invenzione sicura di sé, cioè il fallimento che più ti interessa conoscere.
Aggiungi due trappole
Domande con una premessa falsa:
Perché quest'anno abbiamo tagliato il budget per la formazione? (quando non è stato tagliato)
Un buon agente mette in discussione la premessa. Uno cattivo ti spiega, con eleganza, la tua decisione immaginaria.
Scegli tre controlli
Valutatori sul dataset. Resisti alla tentazione di aggiungere tutto.
Strumenti utilizzati, impostato sullo strumento di ricerca nella raccolta. Conferma che è andato a cercare invece di rispondere a memoria. Gratuito e deterministico.
Fedeltà. Verifica che ogni affermazione sia sostenuta dai documenti che ha recuperato. È il rilevatore di invenzioni.
Un giudice personalizzato. Aggiungi valutatore personalizzato:
- Etichetta:
Ammette di non sapere - Criterio:
0 = afferma una politica o una cifra che i documenti non sostengono. 1 = quando i documenti non rispondono alla domanda, lo dice chiaramente e suggerisce a chi chiedere. Anche le risposte pienamente sostenute dai documenti prendono 1.
Ancorare esplicitamente lo 0 e l'1 è quello che rende coerente un giudice.
Eseguilo
Esegui dataset, scegli il tuo e guarda. Quattordici casi con tre controlli richiedono qualche minuto.
Leggilo come si deve
Probabilmente otterrai qualcosa come 9/14. È un primo risultato normale e utile.
Apri la griglia Casi × valutatori:
Scorri prima le colonne. Una colonna che fallisce quasi sempre è un problema del controllo o qualcosa di sistemico. Se Strumenti utilizzati fallisce in modo diffuso, il tuo agente non sta cercando, ed è la cosa più importante che imparerai oggi.
Poi le righe. I tuoi casi di rifiuto e le trappole sono quelli interessanti. Apri i fallimenti e leggi la motivazione del giudice.
Controlla che la motivazione sia giusta. A volte l'agente aveva ragione e il tuo criterio aveva torto. Sistema il criterio, e nota che è per questo che i criteri si scrivono prima di dare fiducia ai punteggi.
Cambia esattamente una cosa
Diciamo che le trappole sono fallite e ti ha spiegato un taglio di budget mai avvenuto. Modifica le istruzioni dell'agente:
Se una domanda dà per scontato qualcosa che non puoi verificare nei
documenti, dillo prima di rispondere. Non accettare la premessa di una
domanda come un fatto solo perché è stata affermata.
Se i documenti non coprono qualcosa, dillo chiaramente e suggerisci a chi
chiedere. Non riempire mai il vuoto con una risposta che suona plausibile.Salva. Questo crea una nuova Revisione.
Non cambiare nient'altro. Non i casi, non i controlli. Una variabile sola.
Esegui di nuovo e confronta
Esegui lo stesso dataset. Poi apri la nuova esecuzione e usa Confronta con… sulla prima.
Ottieni le Variazioni punteggi per controllo, le Modifiche specifica tra le due revisioni (la tua modifica alle istruzioni) e le Variazioni punteggio per caso.
Quest'ultima è quella da leggere. Una media che si è mossa appena può nascondere tre casi sistemati e due rotti, e quelli che hai rotto sono proprio quelli che devi vedere.
Fanne un'abitudine
Adesso hai un punto di riferimento. Da qui:
Riesegui prima di pubblicare qualsiasi modifica, soprattutto su un agente condiviso.
Aggiungi ogni fallimento reale come caso. Qualcuno segnala una risposta sbagliata, e quella diventa il caso quindici. Nel giro di due mesi questa è la parte più preziosa del dataset.
Non rincorrere il 14/14. Un dataset che passa sempre ha smesso di fare il suo lavoro. Un punteggio stabile con fallimenti noti e compresi è più sano di uno perfetto.
Se ti blocchi
Passa tutto alla prima esecuzione. I tuoi casi sono troppo facili. Aggiungi rifiuti e trappole più difficili.
Fallisce tutto. Di solito è un solo controllo configurato male. Apri una cella e leggi la motivazione prima di toccare l'agente.
I punteggi oscillano tra esecuzioni identiche. I giudici basati su modelli non sono perfettamente ripetibili. Guarda gli andamenti su più esecuzioni, non un punto singolo, e usa le ripetizioni per un caso di cui dubiti il risultato: prende la media e passa solo se ogni ripetizione passa.
Sta costando più del previsto. Ogni controllo basato su un modello è una chiamata per caso. Sfoltisci i controlli, oppure esegui il dataset meno spesso. La vista Costo mostra dove sono finiti i soldi.
Prossimi passi
- Scegliere i controlli per il catalogo completo.
- Costruire un dataset su come generare casi e pubblicare un dataset per il tuo team.
- Leggere i risultati per la dashboard su tutti i tuoi agenti.