Costruire un dataset
Venti buone domande battono duecento domande mediocri. Ecco come sceglierle.
Un dataset è un insieme di casi con un nome e i controlli che vi si applicano. Un agente può averne diversi: uno per le domande di tutti i giorni, uno per quelle scomode, uno per le cose che dovrebbe rifiutare.
Nuovo dataset, dagli un nome e una riga su quando eseguirlo, e comincia ad aggiungere casi.
Cos'è un caso
Input, la domanda, esattamente come la scriverebbe una persona vera. Scrivi la versione disordinata, non quella ordinata, perché la versione disordinata è quella che manderanno i tuoi colleghi.
Output atteso (facoltativo), una risposta di riferimento. Alcuni controlli ne hanno bisogno, la maggior parte no. Scrivilo quando esiste una risposta univocamente giusta, e lascialo vuoto quando non esiste.
Metadati (facoltativi), etichette tue come {"difficulty": "hard"}, utili per dare un senso ai risultati più avanti.
Sovrascrizioni valutatori (facoltative), controlli solo per questo caso, altrimenti eredita quelli del dataset.
Scegliere i tuoi venti
È la parte che determina se tutto l'esercizio è utile, e l'istinto (scrivere venti domande normali) produce un dataset che passa in eterno e non ti insegna niente.
Una buona distribuzione:
Qualche domanda davvero ordinaria. Il pane quotidiano. Se queste falliscono, c'è qualcosa di gravemente sbagliato.
Quelle scomode. Ambigue, sotto-specificate, o con dentro un'assunzione nascosta. "Quanti giorni mi spettano?" quando la risposta dipende dal paese.
Quelle che dovrebbe rifiutare o su cui dovrebbe essere cauto. Fuori dalla sua competenza, o dove la risposta onesta è "i documenti non lo dicono". È il gruppo che le persone tralasciano, ed è dove gli agenti falliscono più spesso: rispondendo con sicurezza a qualcosa che avrebbero dovuto rifiutare.
Quelle che ti hanno morso. Ogni volta che l'agente sbaglia qualcosa nell'uso reale, aggiungila come caso. Nel giro di un paio di mesi questa diventa la parte più preziosa del dataset, perché è un elenco di errori che non può più commettere in silenzio.
Una o due con una trappola. Una domanda con una premessa falsa. "Perché abbiamo dismesso il piano Pro?" quando non l'avete fatto. Ti corregge, oppure inventa un motivo?
Venti casi scelti così ti dicono più di duecento varianti di "qual è la nostra politica di rimborso".
Generare i casi
Se il blocco è fissare un elenco vuoto, Genera ti abbozza qualche caso: descrivi il dominio, di' quanti ne vuoi, e se vuoi dai un paio di esempi per dare il tono.
Poi revisioni ogni bozza, modificando, eliminando o rigenerando singolarmente prima di accettare. Niente viene salvato finché non accetti.
I casi generati sono un punto di partenza, non un dataset. Tendono a raggrupparsi attorno all'ovvio, che è esattamente il gruppo che ti insegna meno.
Usali per le domande ordinarie, poi aggiungi a mano quelle scomode, i rifiuti e le trappole. Sono quelle che nascono dal conoscere il mestiere, e nessun generatore conosce il tuo mestiere.
Partire da un modello
Parti da un modello copia un dataset che qualcuno nella tua organizzazione ha pubblicato, oppure uno di partenza integrato di Asteria Labs.
Ottieni una copia tua. Le modifiche successive all'originale non la raggiungono mai, e le tue modifiche non toccano mai la loro.
Pubblica il tuo con Pubblica nel catalogo, e tutti nella tua organizzazione potranno leggere e copiare ogni caso di prova che contiene. Rimuoverlo in seguito non tocca le copie che le persone hanno già fatto.
Banche di domande condivise
Quando più agenti duplicano lo stesso modello, la vista Banche di domande condivise li raggruppa e li ordina per l'ultimo tasso di successo. Utile per uno standard che tutti dovrebbero raggiungere: un agente ben al di sotto degli altri si vede.
Leggi quella classifica con un'avvertenza in mente, che la vista stessa dichiara: duplicare copia le domande in quel momento. Una copia modificata da allora potrebbe non fare più le stesse domande, quindi un punteggio più basso può significare un dataset più difficile invece di un agente peggiore.
Tenere onesto un dataset
Aggiungi i fallimenti veri. L'abitudine di maggior valore in assoluto. Gli errori reali battono quelli immaginati.
Non modificare un caso per farlo passare. Tentante, e distrugge il senso di tutto. Se un caso è davvero ingiusto, sistemalo. Se è giusto e fallisce, quello è il dataset che sta facendo il suo lavoro.
Pota quelli che non falliscono mai. Un caso che ha passato quaranta esecuzioni di fila costa soldi e non ti dice niente. Tienine qualcuno come sentinella e manda in pensione gli altri.
Lascialo stare quando confronti. Cambiare i casi e l'agente insieme significa non poter capire cosa ha spostato il punteggio.