Come si misura la qualità di un software di IA documentale?
Un software di IA documentale permette di interrogare contratti, manuali, policy, normative, report, procedure e archivi aziendali attraverso domande in linguaggio naturale, ottenendo risposte sintetiche accompagnate dalle relative fonti.
Quando però la documentazione è complessa, tecnica o normativa, la qualità di un sistema non può essere valutata soltanto dalla rapidità o dalla chiarezza della risposta. La domanda centrale diventa un’altra: quanto sono affidabili le informazioni restituite e come è possibile misurarne l’affidabilità in modo oggettivo?
Perché misurare la qualità di un software di IA documentale?
Un software documentale tradizionale aiuta a organizzare, archiviare e recuperare file. Un sistema di gestione documentale permette inoltre di gestire versioni, permessi, flussi approvativi, classificazione e ricerca.
Un software di IA documentale introduce un passaggio ulteriore: non si limita a recuperare un documento, ma individua le informazioni rilevanti, le interpreta e le utilizza per generare una risposta in linguaggio naturale.
Questa differenza rende necessaria una valutazione specifica della qualità. In un sistema documentale classico, infatti, l’utente consulta direttamente il contenuto originale; con un sistema di IA riceve invece un’informazione già selezionata ed elaborata.
Per valutarne l’affidabilità bisogna quindi verificare almeno tre aspetti: se il sistema recupera le fonti corrette, se interpreta correttamente i contenuti e se la risposta finale è coerente con quanto riportato nella base documentale.
Qualità percepita e qualità misurata
Quando una persona prova un software di IA documentale, il primo giudizio nasce dall’esperienza: la risposta è veloce, chiara, ben scritta, ordinata e facile da leggere. Questa è la qualità percepita, ed è importante perché favorisce l’adozione interna.
La qualità misurata aggiunge un livello più rigoroso: confronta la risposta del sistema con una risposta attesa, definita in anticipo, e con le fonti documentali che la giustificano. Una valutazione seria deve capire se la risposta finale è corretta, se le fonti citate la supportano davvero, se il sistema ha recuperato tutte le informazioni utili e se ha gestito bene eccezioni, condizioni e documenti simili.
Il Golden Dataset: la base della valutazione
Il punto di partenza per misurare la qualità di un software di IA documentale è il Golden Dataset: un insieme controllato di domande, risposte corrette e fonti documentali usato come riferimento per valutare il comportamento del sistema. Un buon Golden Dataset contiene domande rappresentative dell’uso reale, domande difficili, risposte attese, fonti corrette, criteri di valutazione, casi ambigui e richieste fuori perimetro.
La qualità del Golden Dataset determina la qualità della misurazione: se le domande sono troppo semplici, il risultato racconta poco; se sono costruite sui veri punti critici della documentazione, il benchmark diventa molto più utile. Per questo deve nascere dai documenti reali che il sistema dovrà gestire: contratti, manuali tecnici, policy, normative, verbali, report, capitolati, documentazione scientifica o archivi aziendali.
Le domande sfidanti: il vero stress test
Le domande semplici servono a verificare il funzionamento di base del sistema. Le domande sfidanti permettono invece di valutarne il comportamento nei casi in cui il recupero e l’interpretazione delle informazioni diventano più complessi.
Una domanda semplice può richiedere un’informazione presente in modo esplicito in un singolo documento. Una domanda sfidante può invece richiedere di collegare più fonti, confrontare documenti diversi, interpretare una tabella, distinguere tra versioni simili oppure applicare correttamente condizioni ed eccezioni.
Per costruire un benchmark significativo è quindi utile classificare in modo sistematico queste diverse tipologie di difficoltà. Tra i casi più rilevanti rientrano, ad esempio, le domande multi-fonte, quelle basate su tabelle, le richieste che dipendono da informazioni distribuite in più documenti, i confronti tra versioni simili, le domande condizionali, quelle controintuitive, quelle fuori dominio e i casi in cui la risposta dipende da un’informazione implicita.
Una tassonomia di questo tipo può essere progressivamente ampliata in funzione dei nuovi casi d’uso e delle criticità osservate durante i test. Il suo obiettivo è mettere il sistema alla prova proprio nei punti in cui un utilizzo ordinario potrebbe non far emergere immediatamente errori o fragilità.
I KPI principali per valutare un software di IA documentale
Un software di IA documentale svolge più attività insieme: recupera fonti, interpreta contenuti e genera una risposta. Per questo serve più di una metrica. I KPI principali sono Accuracy, Precision e Recall. A questi si aggiunge la capacità del sistema di gestire correttamente le domande “fuori perimetro”, cioè quei casi in cui la base documentale contiene informazioni insufficienti per dare una risposta affidabile. Queste metriche vanno lette insieme: una misura isolata racconta solo una parte del comportamento del sistema, mentre l’insieme dei KPI permette di capire dove il software funziona bene e dove può essere migliorato.
Accuracy: quanto è corretta la risposta finale
L’Accuracy misura la correttezza della risposta prodotta dal sistema. È il KPI più immediato, perché guarda il risultato finale: l’utente ha ricevuto una risposta corretta, completa e utilizzabile?
Per misurarla bene conviene usare una scala di valutazione, ad esempio con il seguente punteggio:
1=Risposta non trovata
2=Risposta trovata, ma errata
3=Risposta parzialmente corretta (es: incompleta)
4=Risposta corretta (equivalente alla golden)
5=Risposta migliore della golden (diventerà la nuova golden). In un benchmark rigoroso solo le risposte >3 saranno considerate esatte, quindi su 100 risposte, se ne avessimo una con score = 3 e tutte le altre con score = 4 o 5 potremo stimare un'accuratezza del 99% (in realtà dopo capiremo meglio che ci sarà un ulteriore parametro, la confidenza della stima, per cui la vera accuratezza stimata sarà inferiore al 99%).
La Precision misura la qualità delle fonti selezionate dal sistema. La domanda è semplice: tra le fonti che il sistema ha scelto, quante erano davvero utili per rispondere?
La formula è: Precision = fonti corrette recuperate / tutte le fonti recuperate.
Nel caso dell’IA documentale, parlare di “fonte” richiede attenzione: a volte il file è corretto, ma il passaggio scelto è debole; altre volte il documento è pertinente, ma la sezione recuperata supporta solo in parte la risposta. Per questo la valutazione deve scendere al livello utile: paragrafo, clausola, tabella, riga, sezione o allegato. Occorre quindi ragionare sulle k-fonti scelte dal sistema, cioè l’insieme dei passaggi documentali che il software seleziona per generare la risposta, e le confronta con le fonti utili identificate nel Golden Dataset.
Precision: quanto sono pertinenti le fonti recuperate
La Recall misura la completezza del recupero. La domanda è: tra tutte le fonti utili presenti nella base documentale, quante sono state trovate dal sistema?
La formula è: Recall = fonti corrette recuperate / tutte le fonti corrette necessarie.
Questa metrica diventa decisiva nelle domande multi-fonte, perché molte risposte aziendali, tecniche o normative richiedono informazioni distribuite in documenti diversi: una definizione, una condizione, una clausola, una tabella, un’eccezione, una nota. Quando il sistema recupera solo una parte di queste fonti, la risposta può sembrare solida ma risultare incompleta.
Nei software di gestione documentale evoluti, questo KPI è spesso il più rivelatore, perché mette in evidenza i casi in cui il sistema trova qualcosa di corretto ma lascia fuori un’informazione decisiva.
Recall: quante fonti utili sono state trovate
Perché Precision, Recall e Accuracy vanno lette insieme?
Precision e Recall misurano il recupero delle fonti. Accuracy misura la qualità della risposta finale. Sono metriche collegate, ma non equivalenti.
Un sistema può recuperare fonti pertinenti e complete e poi utilizzarle in modo impreciso durante la generazione della risposta. Può, per esempio, interpretare male una tabella, applicare in modo errato un’eccezione, confondere una regola generale con un caso specifico oppure sintetizzare due documenti in maniera non corretta.
Esiste anche un caso meno intuitivo: Precision e Recall possono risultare molto elevate mentre l’Accuracy rimane sensibilmente più bassa. Può accadere quando il sistema recupera quasi tutte le fonti rilevanti, ma l’informazione decisiva per rispondere alla domanda si trova proprio nella piccola parte che non è stata recuperata.
Immaginiamo, per esempio, che il sistema individui correttamente il 99% delle informazioni pertinenti, ma che nell’1% mancante sia contenuta un’eccezione che modifica completamente la risposta. Le fonti recuperate sono quasi tutte corrette e pertinenti, ma non sono sufficienti per arrivare alla conclusione giusta.
Per questo Precision e Recall elevate non garantiscono automaticamente un’Accuracy altrettanto elevata: un sistema di IA documentale deve non solo recuperare fonti pertinenti, ma individuare tutte le informazioni determinanti e utilizzarle correttamente nella risposta finale.
Quando il sistema deve dichiarare i propri limiti
Un sistema documentale avanzato sa riconoscere quando i documenti disponibili contengono informazioni insufficienti. In questi casi, la risposta migliore è una comunicazione chiara: il sistema indica cosa ha trovato, cosa manca e perché la base documentale consente solo una risposta parziale o richiede ulteriore verifica. Questa capacità è spesso chiamata Negative Rejection. Il nome è tecnico, ma il concetto è molto pratico: il sistema deve gestire correttamente le domande fuori perimetro.
Esempi tipici sono una procedura assente nei documenti, una policy citata dall’utente ma non caricata, una clausola mancante nel contratto, una versione non disponibile o una domanda che richiede conoscenza esterna al corpus. Nei contesti regolamentati, legali, scientifici, tecnici o finanziari, questa capacità vale quanto la risposta corretta.
Gli LLM hanno migliorato moltissimo la capacità dei sistemi documentali di leggere, sintetizzare e rispondere all’utente. Anche i modelli più avanzati, però, restano componenti probabilistiche. Finestre di contesto molto ampie, anche nell’ordine di milioni di token, aumentano le possibilità di analisi ma non trasformano automaticamente un modello in un giudice perfetto della documentazione. Le basi documentali complesse presentano difficoltà specifiche: fonti simili, versioni obsolete, clausole in conflitto, eccezioni sparse, tabelle articolate, immagini, allegati, domande ambigue e richieste che richiedono più passaggi logici.
Questo impatta direttamente la creazione del Golden Dataset e la valutazione tramite LLM-as-a-judge. Un LLM può aiutare a proporre domande, generare varianti e accelerare il lavoro preparatorio; tuttavia la validazione umana resta essenziale per confermare risposte attese, fonti corrette e difficoltà reale dei casi.
I limiti degli LLM nell’IA documentale
Human in the Loop e LLM-as-a-judge
La valutazione di un software di IA documentale può combinare esperti umani e modelli linguistici. La valutazione umana è preziosa quando i documenti sono specialistici: contratti, normative, manuali tecnici, pubblicazioni scientifiche, procedure interne, policy, capitolati o documentazione finanziaria. L’esperto riconosce sfumature, eccezioni, priorità tra fonti e impatto pratico della risposta. L’LLM-as-a-judge consente invece di accelerare la valutazione: un modello può analizzare molte risposte secondo una griglia composta da correttezza, completezza, supporto documentale, chiarezza e aderenza alle fonti. L’approccio più robusto combina i due livelli: l’esperto definisce Golden Dataset e criteri, il modello aiuta a valutare grandi volumi, l’uomo controlla casi critici e borderline, i risultati alimentano il miglioramento del sistema.
Quante domande servono per misurare l’accuratezza?
La dimensione del Golden Dataset influenza direttamente la solidità della misura. Un test iniziale può utilizzare un numero contenuto di domande per individuare pattern di errore, confrontare configurazioni e capire dove intervenire. Quando però il benchmark deve supportare decisioni più importanti, è necessario lavorare su un campione più ampio.
Il motivo è statistico: l’accuratezza osservata sul test è una stima dell’accuratezza reale del sistema, e ogni stima contiene un margine di incertezza. Più piccolo è il campione, più il risultato può essere influenzato dal caso.
Se, per esempio, un sistema risponde correttamente a 99 domande su 100, il risultato osservato è un’Accuracy del 99%. Questo dato, però, non significa che il sistema risponderà correttamente esattamente nel 99% dei casi futuri: cento domande sono ancora un campione relativamente limitato e la percentuale reale potrebbe essere più bassa o più alta.
Aumentando il numero di domande, l’intervallo di incertezza si restringe e la stima diventa più affidabile. In termini pratici, circa 100 domande possono essere sufficienti per una prima indicazione e per individuare problemi evidenti; un dataset nell’ordine delle 400 domande consente una valutazione più stabile; arrivare intorno alle 1.500 domande offre una base ancora più robusta quando si vogliono misurare con maggiore confidenza livelli di accuratezza molto elevati.
Non esiste quindi un numero valido in assoluto. La dimensione del campione deve essere proporzionata sia al livello di accuratezza che si vuole dimostrare, sia al rischio associato al caso d’uso. Un assistente interno utilizzato per consultare documentazione generale può richiedere un livello di confidenza diverso rispetto a un sistema che supporta attività legali, tecniche, mediche, finanziarie o normative.
Come impostare un benchmark tra software di IA documentale?
Per confrontare due sistemi serve un perimetro comune. Questo perimetro può essere chiamato ODD — Operational Design Domain: l’insieme delle condizioni in cui il sistema viene valutato. Un ODD ben definito chiarisce quali documenti entrano nel test, quanti file compongono la base documentale, quali formati vengono usati, quante pagine o parole contiene il corpus, quali versioni sono valide, quali domande vengono incluse (vedi sopra le 20 tipologie by LogosForge)e quali KPI vengono misurati. Il benchmark deve considerare anche la complessità dei file: PDF, Word, Excel, CSV, immagini, scansioni, tabelle, disegni tecnici, allegati e documenti con strutture diverse. Un confronto tra soluzioni ha valore quando avviene sullo stesso corpus, con le stesse domande, gli stessi criteri e la stessa profondità di valutazione.
In un sistema di IA documentale, le fonti sono parte della risposta. Vedere il nome del file aiuta, ma vedere il passaggio esatto è molto più utile. Un software affidabile dovrebbe mostrare il paragrafo, la sezione, la clausola, la riga di tabella o l’allegato da cui deriva l’informazione. Questo permette di verificare pertinenza della fonte, supporto alla risposta, completezza del recupero, presenza di versioni più aggiornate e coerenza tra risposta e documento. La trasparenza delle fonti trasforma un assistente conversazionale in uno strumento verificabile. È un punto decisivo per chi usa un software documentale in contesti aziendali, tecnici o regolamentati.
Perché le fonti visibili sono decisive?
Accuratezza e user experience: due parti della stessa qualità.
Un software di IA documentale deve essere accurato e facile da usare. L’utente deve poter fare domande in modo naturale, leggere risposte chiare, consultare fonti, approfondire e capire il livello di affidabilità della risposta. Le dimensioni principali sono correttezza, completezza, chiarezza, velocità, verificabilità delle fonti, gestione delle incertezze, stabilità con basi documentali grandi e comportamento su file complessi. Questa combinazione è particolarmente importante per le organizzazioni che già usano un document management system o un sistema di gestione documentale e vogliono aggiungere capacità di IA mantenendo controllo, governance e tracciabilità.
Una metodologia pratica per misurare la qualità
Un processo di valutazione solido segue una sequenza chiara: definire il dominio documentale, costruire il Golden Dataset, inserire domande sfidanti, eseguire il test sul sistema, calcolare i KPI, analizzare gli errori e ripetere la misura nel tempo. Questo metodo permette di trasformare la qualità da impressione soggettiva a dato osservabile.
Prima si sceglie il perimetro: documenti, versioni, formati, lingua, reparti, casi d’uso e limiti del test. Questa fase serve a rendere chiaro cosa il sistema deve saper gestire e in quali condizioni verrà valutato.
Definire il dominio documentale
1
Per ogni domanda si definiscono risposta attesa, fonti corrette e criteri di valutazione. Il Golden Dataset diventa così il riferimento stabile per misurare la qualità del software di IA documentale.
Costruire il Golden Dataset
2
Il dataset deve includere domande semplici e casi più complessi: multi-fonte, condizionali, tabellari, fuori dominio, basati su eccezioni o su documenti molto simili. In questo modo il benchmark misura anche i punti più delicati del sistema.
Inserire domande sfidanti
3
Eseguire il test sul sistema
4
Si raccolgono risposta generata, fonti recuperate, tempo di risposta e comportamento del sistema. Tutti questi elementi servono a valutare il risultato finale e il processo con cui il sistema lo ha ottenuto.
Accuracy, Precision, Recall e gestione delle domande fuori perimetro vengono valutate separatamente. La lettura combinata di questi indicatori permette di capire se il problema riguarda il recupero delle fonti, la generazione della risposta o la gestione dei casi limite.
5
Calcolare i KPI
Ogni errore va classificato: recupero delle fonti, generazione, interpretazione, fonte mancante, ambiguità, versione errata o gestione del rifiuto. Questa analisi trasforma il benchmark in uno strumento di miglioramento.
6
Analizzare gli errori
La qualità va monitorata dopo aggiornamenti del modello, modifiche al corpus, tuning del sistema o introduzione di nuovi use case. Un software per la gestione documentale con IA deve mantenere prestazioni solide anche quando la base documentale cresce o cambia.
7
Ripetere la misura
Il ruolo di Catenary nella misurazione dell’IA documentale
Catenary lavora sull’IA documentale con una convinzione precisa: l’affidabilità va misurata con metodo. Il metodo Catenary mette al centro Golden Dataset costruiti su documenti reali, 20 tipologie di domande sfidanti, valutazione separata di Accuracy, Precision e Recall, controllo delle domande fuori perimetro, fonti visibili e supervisione umana nei passaggi critici.
Questo approccio è pensato per aziende e organizzazioni che cercano un modo serio per capire quanto sia affidabile un software di IA documentale prima di usarlo in processi reali.
L’obiettivo è trasformare la qualità da impressione soggettiva a misura osservabile, confrontabile e migliorabile nel tempo.
Domande frequenti
Hai altre domande? Consulta le FAQ o contattaci in qualsiasi momento.
-
La qualità si misura confrontando le risposte del sistema con un Golden Dataset composto da domande, risposte corrette e fonti documentali verificate. I KPI principali sono Accuracy nella risposta, Precision, Recall nella ricerca delle fonti e capacità di gestire domande fuori perimetro.
-
L’Accuracy misura la correttezza della risposta finale. La Precision misura quanto sono pertinenti le fonti recuperate dal sistema. La Recall misura quante fonti utili, tra quelle presenti nella base documentale, sono state effettivamente trovate.
-
Il Golden Dataset rende la valutazione ripetibile e confrontabile. Permette di testare un software documentale con IA sugli stessi documenti, con le stesse domande e con criteri di giudizio definiti in anticipo
-
L’LLM-as-a-judge può aiutare a scalare la valutazione, soprattutto su grandi volumi di test. Nei casi critici serve il controllo umano per validare fonti, risposte attese e giudizi borderline. L’approccio più solido combina automazione e Human in the Loop.