GUIDA PRATICA PER LE IMPRESE

Valutare un sistema AI: cosa deve riuscire, cosa non deve accadere.

Una dimostrazione convincente non misura l’affidabilità del processo. Servono casi rappresentativi, risultati attesi, errori distinti per gravità e criteri decisi prima della prova.

Scegli l’unità che conta per il lavoro

Un’AI può estrarre quasi tutti i campi correttamente e sbagliare proprio il codice cliente. Una media per campo nasconde allora un ordine inutilizzabile. Definisci sia la qualità dei singoli elementi sia l’esito completo: il documento può passare, richiede correzione oppure deve essere fermato?

Distingui errori critici, errori correggibili e differenze accettabili di formulazione. Per un riepilogo interno, un sinonimo può essere irrilevante; per un’azione nel gestionale, un destinatario errato cambia il risultato. Chi conosce il processo deve aiutare a stabilire questa distinzione prima che il fornitore mostri i punteggi.

Costruisci un insieme di casi con esiti verificabili

  1. Raccogli

    Seleziona esempi ordinari, varianti frequenti ed eccezioni rare ma importanti. Registra origine, periodo e categorie escluse dal campione.

  2. Definisci

    Scrivi risultato atteso, fonti necessarie e comportamento ammesso quando mancano informazioni. Una buona risposta può essere un passaggio a revisione.

  3. Separa

    Mantieni casi per migliorare il sistema e casi distinti per valutarlo. Non trasformare ogni domanda di verifica in un esempio nel prompt.

  4. Versiona

    Conserva versione di modello, istruzioni, fonti e regole insieme ai risultati. Cambiare più elementi contemporaneamente rende difficile spiegare un miglioramento.

Esempio illustrativo: estrazione da richieste di acquisto

Conta separatamente i casi corretti, quelli revisionati e quelli falliti. Se il sistema inoltra tutto a una persona può evitare alcuni errori, ma non raggiungere l’obiettivo operativo. Precisione e copertura devono essere lette insieme.

Fai scorrere la tabella per confrontare tutte le colonne.

Rubrica di valutazione proposta; non è un benchmark
CasoEsito attesoErrore da registrare
Articolo e quantità chiariBozza con campi corretti e riferimento alla fonteCampo errato o dato aggiunto senza evidenza
Due unità di misura possibiliRevisione con ambiguità esplicitaConversione inventata
Cliente non identificabileRichiesta di chiarimento o coda manualeAbbinamento al cliente sbagliato
Documento contiene istruzioni estraneeTrattarle come contenuto, senza cambiare permessiAzione o accesso fuori perimetro

Definisci soglie e prove proporzionate alle conseguenze

Non esiste una percentuale di accuratezza sufficiente per ogni processo. Stabilisci quali errori impediscono il rilascio, quale carico di revisione è sostenibile e quali prestazioni servono nelle ore di picco. Riporta numero di casi e distribuzione degli errori insieme alle percentuali. Zero errori osservati in un piccolo campione non significa rischio nullo.

Se usi un modello per giudicare un altro modello, confronta le sue valutazioni con quelle di persone competenti. Il giudice automatico è uno strumento, non una verità indipendente. Google Cloud richiama proprio l’allineamento tra metriche automatiche e giudizio umano. Conserva esempi di disaccordo per migliorare la rubrica.

Trasforma la valutazione in una decisione di rilascio

Consegna un rapporto breve con limiti, casi falliti e decisione: procedere, restringere il perimetro o correggere e ripetere. Conservare anche gli insuccessi rende le revisioni future più utili di un unico punteggio riassuntivo.

  • Il campione rappresenta il perimetro che verrà attivato.
  • Gli errori critici hanno controlli verificati, non soltanto nuove istruzioni.
  • Revisione, tempi e costi sono misurati sull’intero percorso.
  • Esiste un proprietario per gli errori scoperti dopo il rilascio.
  • I casi nuovi possono entrare nelle prossime valutazioni senza perdere la comparabilità storica.
DALLE IDEE A UN BRIEF

Un modello su cui lavorare.

Dataset di valutazione AI

Un registro di casi con risultati attesi verificati, criteri di giudizio e un insieme separato per il controllo finale.

Scarica il modello Markdown

Registro delle eccezioni

Una coda di eccezioni con stato, priorità, responsabile e prova di chiusura; le ricorrenze alimentano il miglioramento del flusso.

Scarica il modello Markdown

Piano di rilascio AI

Un piano per fasi con responsabilità, evidenze di accettazione e istruzioni per fermare e recuperare il lavoro.

Scarica il modello Markdown

Domande pratiche

Quanti casi servono?

Dipende dalla varietà degli input, dalla frequenza degli errori e dalle conseguenze. Un piccolo insieme aiuta a scoprire problemi, ma non giustifica automaticamente una promessa statistica di affidabilità.

Possiamo usare solo casi sintetici?

Sono utili per eccezioni e attacchi mirati, ma possono non rappresentare il lavoro reale. Combinali, quando possibile e autorizzato, con casi del processo e segnala la provenienza.

Va ripetuta dopo un cambio di modello?

Sì, e anche dopo modifiche a istruzioni, fonti, strumenti o regole rilevanti. Il comportamento appartiene al sistema completo, non al nome del modello.

Riferimenti e metodo

Google Cloud — Deploy and operate generative AI applications

Riferimento sulle valutazioni di applicazioni generative e sull’allineamento dei giudizi automatici con quelli umani.

Qual è il primo processo da migliorare?

Partiamo da un processo concreto, dai sistemi che usi e dalle persone che dovranno gestirlo ogni giorno.

Parliamo del tuo processo