Estrarre dati da PDF con l'AI: come verificare ciò che viene letto
Trasformare documenti variabili in dati controllabili prima di inserirli nei sistemi.
Redazione SqualiOnline · 2026-09-07
Un sistema che legge una fattura e restituisce dieci campi compilati fa una buona impressione. Il problema arriva dopo: su duemila documenti, come si fa a sapere quali dieci campi sono sbagliati? L’estrazione automatica non si valuta sulla dimostrazione riuscita, ma su che cosa succede quando sbaglia in silenzio. Questa guida serve a progettare i controlli prima di far scrivere quei dati da qualche parte.
Prima i campi, poi lo strumento
La prima decisione non è tecnologica: è l’elenco dei campi che vi servono, con il formato e la regola di ciascuno, scritto prima di provare qualunque strumento.
- Quali campi. Non «tutto quello che c’è nel documento»: solo i campi che qualcuno userà. Ogni campo estratto è un campo da controllare.
- Che formato. Una data è un giorno preciso, non una riga di testo; un importo ha una valuta e dei decimali; un codice ha una lunghezza. Senza formato non esiste controllo automatico.
- Quali documenti sono ammessi. Un file generato da un altro sistema si legge in un modo, la scansione storta di un foglio timbrato è un altro problema. Dire «accettiamo tutto» significa non avere una soglia di qualità.
- Che cosa fare quando un campo non c’è. È il caso più frequente e il meno progettato: il documento è valido ma quel dato non compare. La risposta non può essere un valore ricostruito a intuito.
Se questo elenco non si riesce a scrivere, il problema non è l’intelligenza artificiale: è che il processo a valle non è definito e nessuno sa che cosa se ne farà dei dati.
Tre operazioni diverse chiamate «lettura»
Nella stessa frase vengono confuse tre cose che sbagliano in modo diverso e vanno verificate in modo diverso.
- Il riconoscimento del testo: trasformare un’immagine in caratteri. Qui gli errori sono materiali — un otto letto come tre, una riga tagliata dalla piega del foglio, una parte fuori inquadratura. Un documento nato digitale salta questo passaggio ed è molto più affidabile.
- L’estrazione: decidere quale, fra i numeri presenti, è il totale, e quale delle tre date è quella di emissione. Qui gli errori sono di interpretazione, e sono i più pericolosi perché il risultato è sempre plausibile.
- Il controllo: stabilire se il dato estratto è coerente con il resto. È l’unico dei tre passaggi che può accorgersi che qualcosa non torna, ed è quello che quasi nessuno progetta.
Un sistema che salta il terzo passaggio non è automatizzato: ha soltanto spostato il controllo su chi riceve i dati, senza dirglielo.
La tabella dei campi
Il documento di progetto più utile è una tabella con una riga per campo. Un esempio, su una fattura ricevuta da un fornitore.
| Campo | Dove si trova | Controllo | Se il controllo fallisce |
|---|---|---|---|
| Fornitore | Intestazione | La partita IVA esiste in anagrafica | A revisione, con proposta di nuovo fornitore |
| Numero documento | Intestazione | Non è già presente per lo stesso fornitore | Bloccato: possibile duplicato |
| Data | Intestazione | È una data valida e non futura | A revisione |
| Imponibile | Riepilogo | Somma delle righe, con tolleranza di arrotondamento | A revisione, con la differenza in evidenza |
| Imposta | Riepilogo | Coerente con imponibile e aliquote indicate | A revisione |
| Totale | Riepilogo | Uguale a imponibile più imposta | Bloccato: il documento non torna |
| Riferimento ordine | Corpo o note | Corrisponde a un ordine aperto | Passa segnalato, senza riferimento |
Le ultime due colonne sono la guida vera. Un campo senza un controllo e senza una destinazione in caso di errore è un campo che nessuno verificherà mai.
I controlli che si scrivono a mano
I controlli utili non sono statistici: sono aritmetici e anagrafici, e proprio per questo sono affidabili.
- Coerenza interna: i totali tornano, le righe sommano, le percentuali si ricalcolano.
- Coerenza con ciò che sapete già: il fornitore esiste, il numero d’ordine esiste, quel cliente ha davvero quella sede.
- Plausibilità: una data del secolo scorso, un importo fuori scala di tre ordini di grandezza, una quantità negativa dove non può esserlo.
- Duplicati: lo stesso documento caricato due volte è un errore più comune di un campo letto male, e più costoso.
Quando un controllo fallisce non si corregge in automatico. Si manda a revisione: correggere da solo un dato di cui il sistema si è già mostrato incerto è il modo più diretto per creare errori invisibili.
Dove passa la revisione umana
L’obiettivo realistico non è eliminare la persona: è farle guardare pochi documenti invece di tutti, e sapere quali.
- I documenti che superano tutti i controlli proseguono, con la loro traccia.
- I documenti con un controllo fallito vanno in una coda di revisione, con il campo problematico evidenziato e il documento originale accanto: chi corregge non deve cercare.
- I documenti bloccanti — un totale che non torna, un possibile duplicato — non proseguono in nessun caso, nemmeno quando c’è fretta.
La coda di revisione va letta come un indicatore. Se cresce sempre sullo stesso tipo di documento o sullo stesso fornitore, quasi mai la soluzione è migliorare l’estrazione: è chiedere quel documento in un formato diverso.
Conservare la provenienza
Per ogni dato scritto in un sistema si deve poter risalire a dove è stato preso. Non è burocrazia: è la condizione per poter contestare, correggere e capire.
- Il documento originale, conservato e collegato al dato.
- Il punto del documento da cui il valore è stato estratto, per ritrovarlo senza rileggere tutto.
- Se il valore è stato corretto a mano: da chi, quando, e qual era il valore precedente.
- Quali controlli sono stati eseguiti e con quale esito.
Senza queste quattro informazioni, quando fra un anno un numero risulterà sbagliato non si saprà se l’errore è nella lettura, nella correzione o nel documento di partenza.
Quello che questa guida non copre
Qui si tratta l’estrazione assistita: che cosa si può leggere da un documento e come si verifica. Non esiste una configurazione che garantisca accuratezza totale, e nessun dato estratto dovrebbe entrare in contabilità senza i controlli descritti. Il caso di un sistema che non si limiti a leggere ma scriva o modifichi dati in un gestionale è un problema diverso, di permessi e di azioni consentite, e ha una guida propria; anche il trasferimento una tantum di dati da fogli di calcolo o da un vecchio sistema segue un metodo suo.
Domande frequenti
Su quali documenti conviene cominciare?
Su quelli numerosi, ripetitivi e con controlli aritmetici possibili, come le fatture ricevute o i documenti di trasporto. Sono i casi in cui l’errore si può scoprire da soli. I contratti e i documenti tecnici, dove il dato è discorsivo e non verificabile con una somma, sono il punto di arrivo, non di partenza.
Che differenza c’è fra un sistema a regole e uno basato su modelli?
Un sistema a regole cerca il dato in una posizione fissa: è preciso finché il documento non cambia impaginazione. Un modello tollera la variabilità, ma quando sbaglia produce un risultato plausibile. Nella pratica si combinano, e in entrambi i casi servono gli stessi controlli a valle.
Chi risponde se un dato estratto male produce un errore?
Chi usa il dato, non chi lo ha letto. È la ragione per cui i controlli automatici, la coda di revisione e la tracciabilità della fonte non sono accessori: sono il modo in cui l’azienda mantiene il controllo su ciò che entra nei propri sistemi.
Valutiamo quali documenti puoi elaborare in modo assistito.
Se ne vuoi parlare, il servizio che se ne occupa è Intelligenza artificiale.

