Saltar al contenido
PDFLove

por qué el ocr me sale mal

En qué se equivoca el OCR y cómo arreglarlo

El OCR es reconocimiento, no conversión, así que tiene una precisión y no un resultado. Casi todo lo que determina esa precisión se decidió antes de que el archivo llegara a ningún software: en el escáner.

01

Qué está haciendo el OCR

El reconocimiento óptico de caracteres toma la imagen de una página, localiza las formas que parecen texto y decide a qué carácter se parece más cada forma. Los motores modernos contrastan luego el resultado con un modelo del idioma, y por eso una "rn" leída como "m" se corrige a menudo en silencio dentro de una palabra real y se deja tal cual dentro de un código de producto.

Ese último punto es lo que hay que entender. El OCR es más preciso justo donde menos lo necesitas — la prosa corriente, donde el contexto lo rescata — y menos preciso en números de serie, referencias de cuenta y cifras, donde no hay contexto que rescate nada y donde un error cuesta más caro.

02

Qué arruina la precisión

Una resolución por debajo de 300 PPP. Es el factor más determinante con diferencia. A 300 PPP un carácter de 10 puntos mide unos 40 píxeles de alto y no es ambiguo. A 150 PPP mide 20 píxeles y el motor está adivinando entre formas parecidas. Escanear por encima de 400 PPP rara vez ayuda y lo ralentiza todo.

La inclinación. Una página escaneada un par de grados torcida es mucho más difícil de leer, porque la detección de líneas da por hecho que las bases son horizontales. Dos grados bastan para que importe y son fáciles de no ver a simple vista.

El poco contraste. Las fotocopias desvaídas, los fondos grises, el papel de color y el rotulador fluorescente sobre el texto reducen la separación entre tinta y papel de la que depende el motor.

Los artefactos del JPEG. Comprimir mucho un escaneo antes de pasar el OCR emborrona los bordes de los caracteres. Si vas a hacer las dos cosas, primero el OCR y después la compresión.

La maquetación. El texto a varias columnas, las tablas, los recuadros laterales y las notas al pie obligan al motor a deducir el orden de lectura antes de leer nada, y equivocarse ahí desordena un reconocimiento por lo demás perfecto.

03

Qué no va a hacer el OCR

La letra manuscrita, en general. Reconocer cursiva es un problema bastante más difícil que reconocer letra impresa, y el OCR de uso general lo hace mal. Las mayúsculas de imprenta bien trazadas a veces funcionan.

Reconstruir una tabla como es debido. Muchas veces puede leer todas las celdas correctamente y aun así producir una tabla estructuralmente equivocada, porque decidir dónde empiezan las columnas es una inferencia distinta de leer los caracteres.

Recuperar información que no está. Si el escaneo está demasiado desvaído para que tú leas un dígito con certeza, ningún motor lo va a hacer mejor — y, a diferencia de ti, se comprometerá con una respuesta sin señalar la duda.

04

Cómo conseguir un resultado mejor

Vuelve a escanear si puedes. Treinta segundos a 300 PPP, recto y con buen contraste, ganan a cualquier cantidad de posprocesado sobre un mal escaneo. Si el documento se va a usar en serio, es tiempo bien invertido.

Endereza antes de reconocer. Incluso un enderezado aproximado recupera muchísimo en una página que entró torcida.

Convierte a escala de grises en vez de a un blanco y negro agresivo. La conversión a dos niveles con el umbral equivocado se come los trazos finos y cierra los ojales de las letras, y las dos cosas perjudican al reconocimiento.

Configura el idioma. Un motor que espera español en un documento en alemán se corregirá hasta llegar a un disparate lleno de confianza.

Y luego revisa la salida, en concreto los números. Coteja las cifras contra el original en vez de leer la prosa por encima. Ahí es donde se esconden los errores que sobreviven, y un dígito mal leído resulta perfectamente creíble sobre la página.

Preguntas

Preguntas relacionadas

¿Qué precisión debería esperar del OCR?

En un escaneo limpio a 300 PPP de texto impreso corriente, bastante por encima del 99% de los caracteres. En una fotocopia desvaída, con columnas apretadas o por debajo de 200 PPP, cae en picado — y los errores que quedan se concentran justo en los sitios donde el contexto no puede arreglarlos.

¿Comprimo antes o después de pasar el OCR?

Después. La compresión funciona descartando detalle de la imagen, y el primer detalle que descarta son los bordes finos, que es exactamente lo que está leyendo el motor de reconocimiento. Primero el OCR, luego comprimes el resultado.

¿El OCR puede leer una foto hecha con el móvil?

A menudo sí, pero con menos fiabilidad que un escaneo. Las fotos de móvil traen iluminación desigual, distorsión de perspectiva por sujetar la cámara en ángulo y sombras. Con el papel plano sobre una mesa, con luz uniforme y disparando desde arriba en perpendicular, la cámara de un móvil moderno se defiende bien.