Scegli l’unità che conta per il lavoro
Un’AI può estrarre quasi tutti i campi correttamente e sbagliare proprio il codice cliente. Una media per campo nasconde allora un ordine inutilizzabile. Definisci sia la qualità dei singoli elementi sia l’esito completo: il documento può passare, richiede correzione oppure deve essere fermato?
Distingui errori critici, errori correggibili e differenze accettabili di formulazione. Per un riepilogo interno, un sinonimo può essere irrilevante; per un’azione nel gestionale, un destinatario errato cambia il risultato. Chi conosce il processo deve aiutare a stabilire questa distinzione prima che il fornitore mostri i punteggi.
Costruisci un insieme di casi con esiti verificabili
Raccogli
Seleziona esempi ordinari, varianti frequenti ed eccezioni rare ma importanti. Registra origine, periodo e categorie escluse dal campione.
Definisci
Scrivi risultato atteso, fonti necessarie e comportamento ammesso quando mancano informazioni. Una buona risposta può essere un passaggio a revisione.
Separa
Mantieni casi per migliorare il sistema e casi distinti per valutarlo. Non trasformare ogni domanda di verifica in un esempio nel prompt.
Versiona
Conserva versione di modello, istruzioni, fonti e regole insieme ai risultati. Cambiare più elementi contemporaneamente rende difficile spiegare un miglioramento.
Esempio illustrativo: estrazione da richieste di acquisto
Conta separatamente i casi corretti, quelli revisionati e quelli falliti. Se il sistema inoltra tutto a una persona può evitare alcuni errori, ma non raggiungere l’obiettivo operativo. Precisione e copertura devono essere lette insieme.
Fai scorrere la tabella per confrontare tutte le colonne.
| Caso | Esito atteso | Errore da registrare |
|---|---|---|
| Articolo e quantità chiari | Bozza con campi corretti e riferimento alla fonte | Campo errato o dato aggiunto senza evidenza |
| Due unità di misura possibili | Revisione con ambiguità esplicita | Conversione inventata |
| Cliente non identificabile | Richiesta di chiarimento o coda manuale | Abbinamento al cliente sbagliato |
| Documento contiene istruzioni estranee | Trattarle come contenuto, senza cambiare permessi | Azione o accesso fuori perimetro |
Definisci soglie e prove proporzionate alle conseguenze
Non esiste una percentuale di accuratezza sufficiente per ogni processo. Stabilisci quali errori impediscono il rilascio, quale carico di revisione è sostenibile e quali prestazioni servono nelle ore di picco. Riporta numero di casi e distribuzione degli errori insieme alle percentuali. Zero errori osservati in un piccolo campione non significa rischio nullo.
Se usi un modello per giudicare un altro modello, confronta le sue valutazioni con quelle di persone competenti. Il giudice automatico è uno strumento, non una verità indipendente. Google Cloud richiama proprio l’allineamento tra metriche automatiche e giudizio umano. Conserva esempi di disaccordo per migliorare la rubrica.
Trasforma la valutazione in una decisione di rilascio
Consegna un rapporto breve con limiti, casi falliti e decisione: procedere, restringere il perimetro o correggere e ripetere. Conservare anche gli insuccessi rende le revisioni future più utili di un unico punteggio riassuntivo.
- Il campione rappresenta il perimetro che verrà attivato.
- Gli errori critici hanno controlli verificati, non soltanto nuove istruzioni.
- Revisione, tempi e costi sono misurati sull’intero percorso.
- Esiste un proprietario per gli errori scoperti dopo il rilascio.
- I casi nuovi possono entrare nelle prossime valutazioni senza perdere la comparabilità storica.
Un modello su cui lavorare.
Dataset di valutazione AI
Un registro di casi con risultati attesi verificati, criteri di giudizio e un insieme separato per il controllo finale.
Scarica il modello MarkdownRegistro delle eccezioni
Una coda di eccezioni con stato, priorità, responsabile e prova di chiusura; le ricorrenze alimentano il miglioramento del flusso.
Scarica il modello MarkdownPiano di rilascio AI
Un piano per fasi con responsabilità, evidenze di accettazione e istruzioni per fermare e recuperare il lavoro.
Scarica il modello MarkdownDomande pratiche
Quanti casi servono?
Dipende dalla varietà degli input, dalla frequenza degli errori e dalle conseguenze. Un piccolo insieme aiuta a scoprire problemi, ma non giustifica automaticamente una promessa statistica di affidabilità.
Possiamo usare solo casi sintetici?
Sono utili per eccezioni e attacchi mirati, ma possono non rappresentare il lavoro reale. Combinali, quando possibile e autorizzato, con casi del processo e segnala la provenienza.
Va ripetuta dopo un cambio di modello?
Sì, e anche dopo modifiche a istruzioni, fonti, strumenti o regole rilevanti. Il comportamento appartiene al sistema completo, non al nome del modello.
Riferimenti e metodo
Riferimento sulle valutazioni di applicazioni generative e sull’allineamento dei giudizi automatici con quelli umani.