Extraer datos de PDF con la IA: cómo verificar lo que se lee
Transformar documentos variables en datos controlables antes de introducirlos en los sistemas.
Equipo editorial de SqualiOnline · 2026-09-07
Un sistema que lee una factura y devuelve diez campos rellenados causa buena impresión. El problema llega después: entre dos mil documentos, ¿cómo se sabe cuáles diez campos están equivocados? La extracción automática no se valora por la demostración que sale bien, sino por lo que ocurre cuando falla en silencio. Esta guía sirve para diseñar los controles antes de dejar que esos datos se escriban en alguna parte.
Primero los campos, después la herramienta
La primera decisión no es tecnológica: es la lista de los campos que necesitáis, con el formato y la regla de cada uno, escrita antes de probar ninguna herramienta.
- Qué campos. No «todo lo que hay en el documento»: solo los campos que alguien usará. Cada campo extraído es un campo que controlar.
- Qué formato. Una fecha es un día preciso, no una línea de texto; un importe tiene una moneda y unos decimales; un código tiene una longitud. Sin formato no existe control automático.
- Qué documentos se admiten. Un archivo generado por otro sistema se lee de una forma, el escaneo torcido de una hoja sellada es otro problema. Decir «lo aceptamos todo» significa no tener un umbral de calidad.
- Qué hacer cuando falta un campo. Es el caso más frecuente y el menos previsto: el documento es válido pero ese dato no aparece. La respuesta no puede ser un valor reconstruido por intuición.
Si esta lista no se consigue escribir, el problema no es la inteligencia artificial: es que el proceso posterior no está definido y nadie sabe qué se hará con los datos.
Tres operaciones distintas llamadas «lectura»
En la misma frase se confunden tres cosas que fallan de forma distinta y hay que verificar de forma distinta.
- El reconocimiento del texto: transformar una imagen en caracteres. Aquí los errores son materiales —un ocho leído como un tres, una línea cortada por el pliegue de la hoja, una parte fuera de encuadre. Un documento nacido digital se salta este paso y es mucho más fiable.
- La extracción: decidir cuál, entre los números presentes, es el total, y cuál de las tres fechas es la de emisión. Aquí los errores son de interpretación, y son los más peligrosos porque el resultado siempre es plausible.
- El control: determinar si el dato extraído es coherente con el resto. Es el único de los tres pasos que puede darse cuenta de que algo no cuadra, y es el que casi nadie diseña.
Un sistema que se salta el tercer paso no está automatizado: solo ha desplazado el control a quien recibe los datos, sin decírselo.
La tabla de los campos
El documento de proyecto más útil es una tabla con una fila por campo. Un ejemplo, sobre una factura recibida de un proveedor.
| Campo | Dónde se encuentra | Control | Si el control falla |
|---|---|---|---|
| Proveedor | Encabezado | El número de IVA consta en los datos maestros | A revisión, con propuesta de nuevo proveedor |
| Número de documento | Encabezado | No está ya presente para el mismo proveedor | Bloqueado: posible duplicado |
| Fecha | Encabezado | Es una fecha válida y no futura | A revisión |
| Base imponible | Resumen | Suma de las líneas, con tolerancia de redondeo | A revisión, con la diferencia resaltada |
| Impuesto | Resumen | Coherente con la base imponible y los tipos indicados | A revisión |
| Total | Resumen | Igual a la base imponible más el impuesto | Bloqueado: el documento no cuadra |
| Referencia del pedido | Cuerpo o notas | Corresponde a un pedido abierto | Pasa marcado, sin referencia |
Las dos últimas columnas son la verdadera guía. Un campo sin un control y sin un destino en caso de error es un campo que nadie verificará nunca.
Los controles que se escriben a mano
Los controles útiles no son estadísticos: son aritméticos y de datos maestros, y precisamente por eso son fiables.
- Coherencia interna: los totales cuadran, las líneas suman, los porcentajes se recalculan.
- Coherencia con lo que ya sabéis: el proveedor existe, el número de pedido existe, ese cliente tiene de verdad esa sede.
- Plausibilidad: una fecha del siglo pasado, un importe fuera de escala en tres órdenes de magnitud, una cantidad negativa donde no puede serlo.
- Duplicados: el mismo documento cargado dos veces es un error más común que un campo mal leído, y más costoso.
Cuando un control falla no se corrige de forma automática. Se envía a revisión: corregir por sí solo un dato sobre el que el sistema ya se ha mostrado incierto es el modo más directo de crear errores invisibles.
Por dónde pasa la revisión humana
El objetivo realista no es eliminar a la persona: es hacer que mire pocos documentos en lugar de todos, y saber cuáles.
- Los documentos que superan todos los controles siguen adelante, con su rastro.
- Los documentos con un control fallido pasan a una cola de revisión, con el campo problemático resaltado y el documento original al lado: quien corrige no tiene que buscar.
- Los documentos bloqueantes —un total que no cuadra, un posible duplicado— no siguen adelante en ningún caso, ni siquiera cuando hay prisa.
La cola de revisión hay que leerla como un indicador. Si crece siempre sobre el mismo tipo de documento o sobre el mismo proveedor, casi nunca la solución es mejorar la extracción: es pedir ese documento en un formato distinto.
Conservar la procedencia
Para cada dato escrito en un sistema debe poder rastrearse de dónde se ha tomado. No es burocracia: es la condición para poder impugnar, corregir y entender.
- El documento original, conservado y vinculado al dato.
- El punto del documento del que se ha extraído el valor, para encontrarlo sin releerlo todo.
- Si el valor se ha corregido a mano: por quién, cuándo, y cuál era el valor anterior.
- Qué controles se han ejecutado y con qué resultado.
Sin estos cuatro datos, cuando dentro de un año un número resulte erróneo no se sabrá si el error está en la lectura, en la corrección o en el documento de partida.
Lo que esta guía no cubre
Aquí se trata la extracción asistida: qué se puede leer de un documento y cómo se verifica. No existe una configuración que garantice una precisión total, y ningún dato extraído debería entrar en contabilidad sin los controles descritos. El caso de un sistema que no se limite a leer sino que escriba o modifique datos en un sistema de gestión es un problema distinto, de permisos y de acciones permitidas, y tiene su propia guía; también la migración puntual de datos desde hojas de cálculo o desde un sistema antiguo sigue un método propio.
Preguntas frecuentes
¿Con qué documentos conviene empezar?
Con los numerosos, repetitivos y con controles aritméticos posibles, como las facturas recibidas o los albaranes de transporte. Son los casos en los que el error se puede descubrir por sí solo. Los contratos y los documentos técnicos, donde el dato es discursivo y no verificable con una suma, son el punto de llegada, no de partida.
¿Qué diferencia hay entre un sistema basado en reglas y uno basado en modelos?
Un sistema basado en reglas busca el dato en una posición fija: es preciso mientras el documento no cambie de maquetación. Un modelo tolera la variabilidad, pero cuando se equivoca produce un resultado plausible. En la práctica se combinan, y en ambos casos hacen falta los mismos controles posteriores.
¿Quién responde si un dato mal extraído produce un error?
Quien usa el dato, no quien lo ha leído. Es la razón por la que los controles automáticos, la cola de revisión y la trazabilidad de la fuente no son accesorios: son el modo en que la empresa mantiene el control sobre lo que entra en sus propios sistemas.
Evaluamos qué documentos puedes procesar de forma asistida.
Si quieres hablarlo, el servicio que se ocupa de esto es Inteligencia artificial.

