por qué el ocr me sale mal
En qué se equivoca el OCR y cómo arreglarlo
El OCR es reconocimiento, no conversión, así que tiene una precisión y no un resultado. Casi todo lo que determina esa precisión se decidió antes de que el archivo llegara a ningún software: en el escáner.
01
Qué está haciendo el OCR
El reconocimiento óptico de caracteres toma la imagen de una página, localiza las formas que parecen texto y decide a qué carácter se parece más cada forma. Los motores modernos contrastan luego el resultado con un modelo del idioma, y por eso una "rn" leída como "m" se corrige a menudo en silencio dentro de una palabra real y se deja tal cual dentro de un código de producto.
Ese último punto es lo que hay que entender. El OCR es más preciso justo donde menos lo necesitas — la prosa corriente, donde el contexto lo rescata — y menos preciso en números de serie, referencias de cuenta y cifras, donde no hay contexto que rescate nada y donde un error cuesta más caro.
02
Qué arruina la precisión
Una resolución por debajo de 300 PPP. Es el factor más determinante con diferencia. A 300 PPP un carácter de 10 puntos mide unos 40 píxeles de alto y no es ambiguo. A 150 PPP mide 20 píxeles y el motor está adivinando entre formas parecidas. Escanear por encima de 400 PPP rara vez ayuda y lo ralentiza todo.
La inclinación. Una página escaneada un par de grados torcida es mucho más difícil de leer, porque la detección de líneas da por hecho que las bases son horizontales. Dos grados bastan para que importe y son fáciles de no ver a simple vista.
El poco contraste. Las fotocopias desvaídas, los fondos grises, el papel de color y el rotulador fluorescente sobre el texto reducen la separación entre tinta y papel de la que depende el motor.
Los artefactos del JPEG. Comprimir mucho un escaneo antes de pasar el OCR emborrona los bordes de los caracteres. Si vas a hacer las dos cosas, primero el OCR y después la compresión.
La maquetación. El texto a varias columnas, las tablas, los recuadros laterales y las notas al pie obligan al motor a deducir el orden de lectura antes de leer nada, y equivocarse ahí desordena un reconocimiento por lo demás perfecto.
03
Qué no va a hacer el OCR
La letra manuscrita, en general. Reconocer cursiva es un problema bastante más difícil que reconocer letra impresa, y el OCR de uso general lo hace mal. Las mayúsculas de imprenta bien trazadas a veces funcionan.
Reconstruir una tabla como es debido. Muchas veces puede leer todas las celdas correctamente y aun así producir una tabla estructuralmente equivocada, porque decidir dónde empiezan las columnas es una inferencia distinta de leer los caracteres.
Recuperar información que no está. Si el escaneo está demasiado desvaído para que tú leas un dígito con certeza, ningún motor lo va a hacer mejor — y, a diferencia de ti, se comprometerá con una respuesta sin señalar la duda.
04
Cómo conseguir un resultado mejor
Vuelve a escanear si puedes. Treinta segundos a 300 PPP, recto y con buen contraste, ganan a cualquier cantidad de posprocesado sobre un mal escaneo. Si el documento se va a usar en serio, es tiempo bien invertido.
Endereza antes de reconocer. Incluso un enderezado aproximado recupera muchísimo en una página que entró torcida.
Convierte a escala de grises en vez de a un blanco y negro agresivo. La conversión a dos niveles con el umbral equivocado se come los trazos finos y cierra los ojales de las letras, y las dos cosas perjudican al reconocimiento.
Configura el idioma. Un motor que espera español en un documento en alemán se corregirá hasta llegar a un disparate lleno de confianza.
Y luego revisa la salida, en concreto los números. Coteja las cifras contra el original en vez de leer la prosa por encima. Ahí es donde se esconden los errores que sobreviven, y un dígito mal leído resulta perfectamente creíble sobre la página.