# Dataset di valutazione AI

Costruisci una raccolta di casi che permetta di confrontare versioni e trovare errori prima che raggiungano il lavoro reale. La qualità dei riferimenti conta quanto quella del modello.

Revisione: 2026-09-24

## Quando usarlo

Prima di scegliere una configurazione AI, modificare istruzioni o fonti, oppure estendere un progetto a nuovi documenti e reparti.

## Risultato atteso

Un registro di casi con risultati attesi verificati, criteri di giudizio e un insieme separato per il controllo finale.

## 1. Copri il lavoro reale

Definisci l’attività valutata prima di raccogliere esempi. Includi casi in cui il comportamento corretto è chiedere aiuto o non rispondere.

### Compito, input e risultato richiesto

Specifica cosa riceve il sistema, cosa deve produrre e quali azioni non deve eseguire.

________________

### Categorie da rappresentare

Elenca frequenza, lingue, formati, casi ambigui, dati mancanti e situazioni con conseguenze elevate.

________________

### Origine e selezione dei casi

Indica periodo, autorizzazione all’uso, anonimizzazione prevista e limiti di rappresentatività del campione.

________________

> Esempio illustrativo, da sostituire: Esempio ipotetico: per estrarre scadenze, includere documenti senza data e date discordanti. Il risultato corretto per un’ambiguità può essere “revisione necessaria”.

## 2. Crea riferimenti verificabili

Assegna a ogni caso un identificativo stabile. Conserva la motivazione del risultato atteso, così un disaccordo può essere risolto senza affidarsi alla memoria.

### Identificativo e input del caso

Collega il file o record approvato e la sua versione; evita dati sensibili nel nome del caso.

________________

### Risultato atteso ed evidenza

Descrivi campi corretti, fonte di supporto, tolleranze accettabili e comportamento quando la risposta manca.

________________

### Revisore e gestione disaccordi

Indica chi valida il riferimento e chi decide quando due valutatori interpretano diversamente il caso.

________________

> Esempio illustrativo, da sostituire: Esempio ipotetico: caso DOC-017, due date presenti ma nessuna indicata come scadenza. Il riferimento richiede di non inventarla e di segnalare le righe da controllare.

## 3. Confronta le versioni

Conserva casi per un controllo che non venga usato a ogni modifica. Misura risultati per categoria, senza nascondere errori critici dietro una media.

### Sviluppo e controllo finale

Registra quali casi servono per migliorare il sistema e quali restano separati per valutarlo.

________________

### Misure e condizioni di accettazione

Definisci errori critici, correttezza per campo, richieste di revisione e limiti concordati sul lavoro residuo.

________________

### Versione, esito e decisione

Salva configurazione, data, risultati per categoria, difetti aperti e motivazione del rilascio o rinvio.

________________

> Esempio illustrativo, da sostituire: Esempio ipotetico: una nuova configurazione legge più date ma inventa una scadenza nel caso ambiguo. Il difetto critico resta visibile anche se la media migliora.

## Errori da evitare

- Usare come riferimento una risposta AI mai verificata da una persona competente.

- Migliorare sullo stesso piccolo insieme e chiamarlo controllo indipendente.

- Contare come successo una risposta formalmente valida ma priva di supporto.

Stolen Orbit — https://stolenorbit.com/it/modelli/dataset-valutazione-ai/

