Dati e statistiche
Accuratezza dell'estrazione degli estratti conto: fatti e cifre
Benchmark dell'estrazione delle transazioni degli estratti conto su 47 banche europee reali: tasso di zero errori a livello di estratto conto, tasso di righe fittizie, recall e precision per Holofin, GPT-5.5, Gemini 3.1 Pro e Claude Opus 4.8. CSV incluso.
- Estratti conto Holofin con zero errori
- 98%
- Riga errata Holofin su 44 estratti conto
- 1
- righe errate per modello di frontiera
- da 70 a 115
- banche, un estratto conto ciascuna, gold verificato manualmente
- 47
In questa pagina
Riepilogo
Su un corpus di 47 estratti conto reali e anonimizzati di 47 diverse banche europee (93 pagine), Holofin restituisce il 98% degli estratti conto con zero errori, una sola riga errata su 44 documenti valutati. Il miglior modello di frontiera, Gemini 3.1 Pro, restituisce l'80% degli estratti conto con zero errori; GPT-5.5 il 77%; Claude Opus 4.8 il 75%.
Il divario è dovuto all'invenzione di dati, non alla lettura. La recall è compresa tra 0,93 e 1,00 per ogni sistema, ma dall'8,3% al 10,0% delle righe restituite da un modello di frontiera non è presente nella pagina. Il tasso di righe fittizie di Holofin è dello 0,1%. Fornire ai modelli di frontiera due pagine o l'intero documento per chiamata sposta la recall di circa un punto e non colma il divario.
Dati
Risultati a livello di estratto conto, 44 estratti conto valutati, finestra per pagina
| Sistema | Estratti conto con zero errori | Righe con errori (tutti i 44 documenti) | Tasso di righe fittizie | Recall | Precisione |
|---|---|---|---|---|---|
| Holofin (pipeline di produzione) | 98% | 1 | 0,1% | 1,000 | 0,999 |
| Gemini 3.1 Pro | 80% | 115 | 10,0% | 0,931 | 0,900 |
| GPT-5.5 | 77% | 84 | 8,3% | 0,939 | 0,917 |
| Claude Opus 4.8 | 75% | 70 | 9,2% | 0,929 | 0,908 |
Un estratto conto è considerato corretto solo se ogni riga di transazione corrisponde al dato verificato manualmente (data, importo con segno) con precisione al centesimo: nessuna riga omessa, nessuna riga fittizia. Il tasso di righe fittizie è la percentuale di righe restituite la cui (data, importo) non è presente nella pagina. I modelli di frontiera sono mostrati nella loro configurazione migliore (per pagina).
Scarica CSVRecall per finestra di contesto, modelli di frontiera
| Modello | Per pagina | Due pagine | Intero documento |
|---|---|---|---|
| GPT-5.5 | 0,939 | 0,942 | 0,932 |
| Gemini 3.1 Pro | 0,931 | 0,953 | 0,932 |
| Claude Opus 4.8 | 0,929 | 0,948 | 0,940 |
Fornire più pagine per chiamata non porta vantaggi: la recall varia di circa un punto in entrambe le direzioni. Holofin elabora una pagina alla volta e non viene mostrato perché ha ottenuto un punteggio di 1.000 nella sua unica configurazione.
Scarica CSVCorpus di benchmark: 47 banche, 93 pagine, un estratto conto per banca
| Banca | Paese | Pagine |
|---|---|---|
| BAMI Banque Michel Inchauspé | FR | 4 |
| Banque Dupuy de Parseval | FR | 1 |
| Banque Transatlantique | FR | 2 |
| Berliner Sparkasse | DE | 1 |
| Berliner Volksbank | DE | 1 |
| BNP Paribas | FR | 1 |
| BoursoBank | FR | 1 |
| BRED Banque Populaire | FR | 2 |
| bunq | NL | 2 |
| BW-Bank | DE | 2 |
| Caisse d'Epargne | FR | 2 |
| Commerzbank | DE | 2 |
| Crédit Agricole Brie Picardie | FR | 1 |
| Crédit Coopératif | FR | 2 |
| CIC | FR | 2 |
| Crédit Mutuel | FR | 1 |
| Deutsche Bank | DE | 2 |
| Deutsche Skatbank | DE | 2 |
| DKB Deutsche Kreditbank | DE | 3 |
| Fiducial Banque | FR | 1 |
| Finom | NL | 1 |
| Grenke Bank | DE | 3 |
| HSBC | FR | 1 |
| HypoVereinsbank | DE | 2 |
| iBanFirst | FR | 3 |
| Kontist | DE | 2 |
| La Banque Postale | FR | 3 |
| LCL | FR | 1 |
| Manager.one | FR | 2 |
| Mein ELBA (Raiffeisen) | AT | 3 |
| Memo Bank | FR | 1 |
| Monabanq | FR | 2 |
| Oberbank | AT | 1 |
| PayPal | LU | 4 |
| Postbank | DE | 1 |
| Qonto | FR | 1 |
| Raiffeisenbank Südstormarn Mölln | DE | 8 |
| Revolut Business | LT | 1 |
| SG Crédit du Nord | FR | 2 |
| Société Générale | FR | 1 |
| Shine | FR | 1 |
| Sparda-Bank | DE | 3 |
| SumUp | GB | 4 |
| Targobank | DE | 4 |
| UniCredit | DE | 1 |
| Viva Wallet | GR | 1 |
| Wise | BE | 1 |
Ogni estratto conto è reale, poi anonimizzato in modo che layout, tabelle e totali rimangano intatti, ma nomi e numeri siano sintetici. Le etichette gold sono state verificate manualmente riga per riga rispetto ai PDF originali. 44 dei 47 estratti conto sono valutati nelle tabelle dei risultati. Il Paese è il mercato di origine dell'ente emittente.
Scarica CSVMetodologia
I modelli di frontiera candidati ricevono le immagini delle pagine con un prompt di estrazione generico in tre dimensioni di contesto (per pagina, due pagine, intero documento). Holofin è la pipeline di produzione (classificazione, OCR, estrazione per pagina) gestita tramite HTTP, una pagina alla volta.
Ogni metrica è document-macro: calcolata per estratto conto, quindi mediata. Una riga corrisponde al gold quando (data_transazione, importo con segno) è esatta al centesimo. Un estratto conto ha zero errori quando viene restituita ogni riga gold e nessuna riga restituita manca dal gold.
Il corpus è composto da un estratto conto per banca distinta, scelto per la diversità del layout piuttosto che ponderato in base al traffico. Sovrarappresenta di proposito layout rari e complessi, quindi i numeri vanno letti come un test di affidabilità nel caso peggiore, non come una previsione dell'accuratezza media in produzione.
La riconciliazione del saldo (saldo iniziale più transazioni uguale saldo finale) è stata misurata ed è necessaria ma non sufficiente: GPT-5.5 riconcilia 42 estratti conto su 45, eppure inventa ancora circa l'8% delle righe, e Gemini 3.1 Pro ha lasciato in bianco i saldi su 12 documenti, che non possono essere riconciliati affatto.
Ha notato un errore? Scriva a [email protected] e correggeremo la riga annotando la modifica.
Fonti
- Holofin, il benchmark per l'estrazione degli estratti conto (articolo completo, grafici e miniature del corpus)(consultato 3 settembre 2026)
Domande frequenti
Perché valutare per estratto conto anziché per riga?
Un estratto conto è booleano per il team che lo riceve: o ogni transazione è corretta, o il documento rappresenta un rischio. Un estratto conto con 27 righe corrette su 30 è accurato al 90% per riga, eppure è sbagliato. In questo benchmark, Gemini 3.1 Pro, GPT-5.5 e Claude Opus 4.8 hanno restituito un estratto conto completamente corretto nel 75-80% dei casi, pur trovando la maggior parte delle righe.
Cosa conta come riga fittizia?
Una riga restituita la cui (data, importo con segno) non corrisponde ad alcuna transazione sulla pagina. Tracciate manualmente, dal 68% al 93% di queste (a seconda del modello) non ha alcun riscontro; il resto è una riga reale letta con un importo o una data errati.
Una finestra di contesto più ampia risolve il problema?
No. Tra i tre modelli di frontiera, le finestre a due pagine e a intero documento spostano la recall di circa un punto in entrambe le direzioni. L'errore dipende dal layout, non dalla finestra.
La riconciliazione del saldo è sufficiente per convalidare un'estrazione?
No. È un controllo necessario, ma non sufficiente. Una riga fittizia compensata da un altro errore fa comunque quadrare i conti, e un modello che omette i saldi non può essere verificato affatto. Il gold deve essere verificato rispetto alla pagina.
Posso riutilizzare questi dati?
Sì, con licenza CC BY 4.0 e attribuzione a Holofin. Ogni tabella ha un download CSV; la metodologia completa si trova nell'articolo linkato.
Estratti conto su cui basare un finanziamento.
Invii a Holofin i Suoi estratti conto: ogni riga riconciliata, ogni PDF controllato contro le manomissioni, ogni valore collegato alla pagina da cui proviene.