Datos y cifras
Precisión en la extracción de extractos bancarios: datos y cifras
Benchmark de extracción de transacciones de extractos bancarios en 47 bancos europeos reales: tasa de cero errores a nivel de extracto, tasa de filas fabricadas, recall y precisión para Holofin, GPT-5.5, Gemini 3.1 Pro y Claude Opus 4.8. CSV incluido.
- Extractos de Holofin con cero errores
- 98%
- Fila errónea de Holofin en 44 extractos
- 1
- filas erróneas por modelo de frontera
- 70 a 115
- bancos, un extracto cada uno, verificado manualmente (gold)
- 47
En esta página
Resumen
En un corpus de 47 extractos reales y anonimizados de 47 bancos europeos diferentes (93 páginas), Holofin procesa el 98% de los extractos con cero errores, con una sola fila errónea en los 44 documentos evaluados. El mejor modelo de frontera, Gemini 3.1 Pro, procesa el 80% de los extractos con cero errores; GPT-5.5 el 77%; Claude Opus 4.8 el 75%.
La diferencia radica en la fabricación de datos, no en la lectura. El recall es de 0.93 a 1.00 para todos los sistemas, pero entre el 8.3% y el 10.0% de las filas que devuelve un modelo de frontera no están en la página. La tasa de filas fabricadas de Holofin es del 0.1%. Proporcionar a los modelos de frontera dos páginas o el documento completo por llamada varía el recall en aproximadamente un punto y no cierra la brecha.
Datos
Resultados a nivel de extracto, 44 extractos evaluados, ventana por página
| Sistema | Extractos con cero errores | Filas con errores (los 44 documentos) | Tasa de filas inventadas | Exhaustividad | Precisión |
|---|---|---|---|---|---|
| Holofin (pipeline de producción) | 98% | 1 | 0,1% | 1,000 | 0,999 |
| Gemini 3.1 Pro | 80% | 115 | 10,0% | 0,931 | 0,900 |
| GPT-5.5 | 77% | 84 | 8,3% | 0,939 | 0,917 |
| Claude Opus 4.8 | 75% | 70 | 9,2% | 0,929 | 0,908 |
Un extracto se considera correcto solo si cada fila de transacción coincide con los datos de referencia verificados manualmente en (fecha, importe con signo) con precisión de centavos: sin filas omitidas ni filas inventadas. La tasa de filas inventadas es la proporción de filas devueltas cuya (fecha, importe) no está en la página. Los modelos de frontera se muestran en su mejor configuración (por página).
Descargar CSVExhaustividad por ventana de contexto, modelos de frontera
| Modelo | Por página | Dos páginas | Documento completo |
|---|---|---|---|
| GPT-5.5 | 0,939 | 0,942 | 0,932 |
| Gemini 3.1 Pro | 0,931 | 0,953 | 0,932 |
| Claude Opus 4.8 | 0,929 | 0,948 | 0,940 |
Procesar más páginas por llamada no supone ninguna diferencia: el recall varía aproximadamente un punto en cualquier dirección. Holofin procesa una página a la vez y no se muestra porque obtuvo una puntuación de 1.000 en su única configuración.
Descargar CSVCorpus del benchmark: 47 bancos, 93 páginas, un extracto por banco
| Banco | País | Páginas |
|---|---|---|
| BAMI Banque Michel Inchauspé | FR | 4 |
| Banque Dupuy de Parseval | FR | 1 |
| Banque Transatlantique | FR | 2 |
| Berliner Sparkasse | DE | 1 |
| Berliner Volksbank | DE | 1 |
| BNP Paribas | FR | 1 |
| BoursoBank | FR | 1 |
| BRED Banque Populaire | FR | 2 |
| bunq | NL | 2 |
| BW-Bank | DE | 2 |
| Caisse d'Epargne | FR | 2 |
| Commerzbank | DE | 2 |
| Crédit Agricole Brie Picardie | FR | 1 |
| Crédit Coopératif | FR | 2 |
| CIC | FR | 2 |
| Crédit Mutuel | FR | 1 |
| Deutsche Bank | DE | 2 |
| Deutsche Skatbank | DE | 2 |
| DKB Deutsche Kreditbank | DE | 3 |
| Fiducial Banque | FR | 1 |
| Finom | NL | 1 |
| Grenke Bank | DE | 3 |
| HSBC | FR | 1 |
| HypoVereinsbank | DE | 2 |
| iBanFirst | FR | 3 |
| Kontist | DE | 2 |
| La Banque Postale | FR | 3 |
| LCL | FR | 1 |
| Manager.one | FR | 2 |
| Mein ELBA (Raiffeisen) | AT | 3 |
| Memo Bank | FR | 1 |
| Monabanq | FR | 2 |
| Oberbank | AT | 1 |
| PayPal | LU | 4 |
| Postbank | DE | 1 |
| Qonto | FR | 1 |
| Raiffeisenbank Südstormarn Mölln | DE | 8 |
| Revolut Business | LT | 1 |
| SG Crédit du Nord | FR | 2 |
| Société Générale | FR | 1 |
| Shine | FR | 1 |
| Sparda-Bank | DE | 3 |
| SumUp | GB | 4 |
| Targobank | DE | 4 |
| UniCredit | DE | 1 |
| Viva Wallet | GR | 1 |
| Wise | BE | 1 |
Cada extracto es real y luego anonimizado para que el diseño, las tablas y los totales se mantengan, pero los nombres y números sean sintéticos. Las etiquetas de referencia (gold) se verificaron manualmente línea por línea contra los PDFs originales. 44 de los 47 extractos se puntúan en las tablas de resultados. El país es el mercado de origen de la entidad emisora.
Descargar CSVMetodología
Los modelos de frontera candidatos reciben imágenes de páginas con un prompt de extracción genérico en tres tamaños de contexto (por página, dos páginas, documento completo). Holofin es el pipeline de producción (clasificación, OCR, extracción por página) ejecutado a través de HTTP, una página a la vez.
Cada métrica es a nivel macro del documento: se calcula por extracto y luego se promedia. Una fila coincide con la referencia (gold) cuando (fecha_transacción, importe con signo) es exacta con precisión de centavos. Un extracto tiene cero errores cuando se devuelve cada fila de referencia y ninguna fila devuelta falta en la referencia.
El corpus consta de un extracto por cada banco distinto, seleccionado por la diversidad de su diseño en lugar de ponderado por volumen de tráfico. Sobrerrepresenta diseños raros y complejos a propósito, por lo que las cifras deben interpretarse como una prueba de fiabilidad en el peor de los casos, no como un pronóstico de la precisión promedio en producción.
La conciliación de saldos (saldo inicial más transacciones igual a saldo final) se midió y es necesaria pero no suficiente: GPT-5.5 concilia 42 de 45 extractos, pero aún así fabrica alrededor del 8% de las filas, y Gemini 3.1 Pro dejó los saldos en blanco en 12 documentos, los cuales no se pueden conciliar en absoluto.
¿Ha detectado un error? Escriba a [email protected] y corregiremos la fila y anotaremos el cambio.
Fuentes
- Holofin, el benchmark de extracción de extractos bancarios (artículo completo, gráficos y miniaturas del corpus)(consultado 3 de septiembre de 2026)
Licencia: CC BY 4.0. Reutilización con atribución a Holofin.
Preguntas frecuentes
¿Por qué evaluar por extracto en lugar de por fila?
Un extracto es booleano para el equipo que lo recibe: o todas las transacciones son correctas o el documento es un riesgo. Un extracto con 27 de 30 filas correctas tiene un 90% de precisión por fila y aun así es erróneo. En este benchmark, Gemini 3.1 Pro, GPT-5.5 y Claude Opus 4.8 devolvieron un extracto completamente correcto entre el 75% y el 80% de las veces, aunque encontraron la mayoría de las filas.
¿Qué se considera una fila fabricada?
Una fila devuelta cuya (fecha, importe con signo) no coincide con ninguna transacción en la página. Al rastrearlas manualmente, entre el 68% y el 93% de estas (según el modelo) no tienen ninguna contraparte; el resto son filas reales leídas con un importe o fecha incorrectos.
¿Lo soluciona una ventana de contexto más grande?
No. En los tres modelos de frontera, las ventanas de dos páginas y de documento completo varían el recall en aproximadamente un punto en cualquier dirección. El fallo depende del diseño, no de la ventana.
¿Es suficiente la conciliación de saldos para validar una extracción?
No. Es una comprobación necesaria, pero no suficiente. Una fila fabricada compensada por otro error sigue cuadrando, y un modelo que omite los saldos no se puede comprobar en absoluto. La referencia (gold) debe verificarse contra la página.
¿Puedo reutilizar estas cifras?
Sí, bajo la licencia CC BY 4.0 con atribución a Holofin. Cada tabla tiene una descarga en CSV; la metodología completa se encuentra en el artículo enlazado.
Lecturas relacionadas
Extractos bancarios en los que puede basar un préstamo.
Envíe a Holofin sus propios extractos: cada fila conciliada, cada PDF revisado contra manipulaciones, cada valor vinculado a la página de la que procede.