Datos y cifras

Precisión en la extracción de extractos bancarios: datos y cifras

Benchmark de extracción de transacciones de extractos bancarios en 47 bancos europeos reales: tasa de cero errores a nivel de extracto, tasa de filas fabricadas, recall y precisión para Holofin, GPT-5.5, Gemini 3.1 Pro y Claude Opus 4.8. CSV incluido.

Por Holofin Research Publicado Actualizado
Extractos de Holofin con cero errores
98%
Fila errónea de Holofin en 44 extractos
1
filas erróneas por modelo de frontera
70 a 115
bancos, un extracto cada uno, verificado manualmente (gold)
47
En esta página

Resumen

En un corpus de 47 extractos reales y anonimizados de 47 bancos europeos diferentes (93 páginas), Holofin procesa el 98% de los extractos con cero errores, con una sola fila errónea en los 44 documentos evaluados. El mejor modelo de frontera, Gemini 3.1 Pro, procesa el 80% de los extractos con cero errores; GPT-5.5 el 77%; Claude Opus 4.8 el 75%.

La diferencia radica en la fabricación de datos, no en la lectura. El recall es de 0.93 a 1.00 para todos los sistemas, pero entre el 8.3% y el 10.0% de las filas que devuelve un modelo de frontera no están en la página. La tasa de filas fabricadas de Holofin es del 0.1%. Proporcionar a los modelos de frontera dos páginas o el documento completo por llamada varía el recall en aproximadamente un punto y no cierra la brecha.

Datos

Resultados a nivel de extracto, 44 extractos evaluados, ventana por página

Resultados a nivel de extracto, 44 extractos evaluados, ventana por página
SistemaExtractos con cero erroresFilas con errores (los 44 documentos)Tasa de filas inventadasExhaustividadPrecisión
Holofin (pipeline de producción)98%10,1%1,0000,999
Gemini 3.1 Pro80%11510,0%0,9310,900
GPT-5.577%848,3%0,9390,917
Claude Opus 4.875%709,2%0,9290,908

Un extracto se considera correcto solo si cada fila de transacción coincide con los datos de referencia verificados manualmente en (fecha, importe con signo) con precisión de centavos: sin filas omitidas ni filas inventadas. La tasa de filas inventadas es la proporción de filas devueltas cuya (fecha, importe) no está en la página. Los modelos de frontera se muestran en su mejor configuración (por página).

Descargar CSV

Exhaustividad por ventana de contexto, modelos de frontera

Exhaustividad por ventana de contexto, modelos de frontera
ModeloPor páginaDos páginasDocumento completo
GPT-5.50,9390,9420,932
Gemini 3.1 Pro0,9310,9530,932
Claude Opus 4.80,9290,9480,940

Procesar más páginas por llamada no supone ninguna diferencia: el recall varía aproximadamente un punto en cualquier dirección. Holofin procesa una página a la vez y no se muestra porque obtuvo una puntuación de 1.000 en su única configuración.

Descargar CSV

Corpus del benchmark: 47 bancos, 93 páginas, un extracto por banco

Corpus del benchmark: 47 bancos, 93 páginas, un extracto por banco
BancoPaísPáginas
BAMI Banque Michel InchauspéFR4
Banque Dupuy de ParsevalFR1
Banque TransatlantiqueFR2
Berliner SparkasseDE1
Berliner VolksbankDE1
BNP ParibasFR1
BoursoBankFR1
BRED Banque PopulaireFR2
bunqNL2
BW-BankDE2
Caisse d'EpargneFR2
CommerzbankDE2
Crédit Agricole Brie PicardieFR1
Crédit CoopératifFR2
CICFR2
Crédit MutuelFR1
Deutsche BankDE2
Deutsche SkatbankDE2
DKB Deutsche KreditbankDE3
Fiducial BanqueFR1
FinomNL1
Grenke BankDE3
HSBCFR1
HypoVereinsbankDE2
iBanFirstFR3
KontistDE2
La Banque PostaleFR3
LCLFR1
Manager.oneFR2
Mein ELBA (Raiffeisen)AT3
Memo BankFR1
MonabanqFR2
OberbankAT1
PayPalLU4
PostbankDE1
QontoFR1
Raiffeisenbank Südstormarn MöllnDE8
Revolut BusinessLT1
SG Crédit du NordFR2
Société GénéraleFR1
ShineFR1
Sparda-BankDE3
SumUpGB4
TargobankDE4
UniCreditDE1
Viva WalletGR1
WiseBE1

Cada extracto es real y luego anonimizado para que el diseño, las tablas y los totales se mantengan, pero los nombres y números sean sintéticos. Las etiquetas de referencia (gold) se verificaron manualmente línea por línea contra los PDFs originales. 44 de los 47 extractos se puntúan en las tablas de resultados. El país es el mercado de origen de la entidad emisora.

Descargar CSV

Metodología

Los modelos de frontera candidatos reciben imágenes de páginas con un prompt de extracción genérico en tres tamaños de contexto (por página, dos páginas, documento completo). Holofin es el pipeline de producción (clasificación, OCR, extracción por página) ejecutado a través de HTTP, una página a la vez.

Cada métrica es a nivel macro del documento: se calcula por extracto y luego se promedia. Una fila coincide con la referencia (gold) cuando (fecha_transacción, importe con signo) es exacta con precisión de centavos. Un extracto tiene cero errores cuando se devuelve cada fila de referencia y ninguna fila devuelta falta en la referencia.

El corpus consta de un extracto por cada banco distinto, seleccionado por la diversidad de su diseño en lugar de ponderado por volumen de tráfico. Sobrerrepresenta diseños raros y complejos a propósito, por lo que las cifras deben interpretarse como una prueba de fiabilidad en el peor de los casos, no como un pronóstico de la precisión promedio en producción.

La conciliación de saldos (saldo inicial más transacciones igual a saldo final) se midió y es necesaria pero no suficiente: GPT-5.5 concilia 42 de 45 extractos, pero aún así fabrica alrededor del 8% de las filas, y Gemini 3.1 Pro dejó los saldos en blanco en 12 documentos, los cuales no se pueden conciliar en absoluto.

¿Ha detectado un error? Escriba a [email protected] y corregiremos la fila y anotaremos el cambio.

Fuentes

  1. Holofin, el benchmark de extracción de extractos bancarios (artículo completo, gráficos y miniaturas del corpus)(consultado 3 de septiembre de 2026)

Licencia: CC BY 4.0. Reutilización con atribución a Holofin.

Preguntas frecuentes

¿Por qué evaluar por extracto en lugar de por fila?

Un extracto es booleano para el equipo que lo recibe: o todas las transacciones son correctas o el documento es un riesgo. Un extracto con 27 de 30 filas correctas tiene un 90% de precisión por fila y aun así es erróneo. En este benchmark, Gemini 3.1 Pro, GPT-5.5 y Claude Opus 4.8 devolvieron un extracto completamente correcto entre el 75% y el 80% de las veces, aunque encontraron la mayoría de las filas.

¿Qué se considera una fila fabricada?

Una fila devuelta cuya (fecha, importe con signo) no coincide con ninguna transacción en la página. Al rastrearlas manualmente, entre el 68% y el 93% de estas (según el modelo) no tienen ninguna contraparte; el resto son filas reales leídas con un importe o fecha incorrectos.

¿Lo soluciona una ventana de contexto más grande?

No. En los tres modelos de frontera, las ventanas de dos páginas y de documento completo varían el recall en aproximadamente un punto en cualquier dirección. El fallo depende del diseño, no de la ventana.

¿Es suficiente la conciliación de saldos para validar una extracción?

No. Es una comprobación necesaria, pero no suficiente. Una fila fabricada compensada por otro error sigue cuadrando, y un modelo que omite los saldos no se puede comprobar en absoluto. La referencia (gold) debe verificarse contra la página.

¿Puedo reutilizar estas cifras?

Sí, bajo la licencia CC BY 4.0 con atribución a Holofin. Cada tabla tiene una descarga en CSV; la metodología completa se encuentra en el artículo enlazado.

Extractos bancarios en los que puede basar un préstamo.

Envíe a Holofin sus propios extractos: cada fila conciliada, cada PDF revisado contra manipulaciones, cada valor vinculado a la página de la que procede.

Holofin