Saltar al contenido
PDFLove

cómo saber si un pdf está escaneado

¿PDF escaneado o PDF de texto? Cómo saberlo

Intenta seleccionar una palabra. Si el cursor la marca palabra por palabra, tienes texto. Si dibuja un recuadro sobre la página entera, tienes una fotografía — y ese único dato explica casi todo lo que un PDF te dejará y no te dejará hacer.

01

Los dos tipos

Un PDF de texto guarda caracteres. Sabe que la página contiene la palabra "factura", sabe con qué tipografía dibujarla y sabe exactamente en qué punto de la hoja va. Todo lo que sale de Word, de un navegador, de un programa de contabilidad o de la exportación de casi cualquier aplicación es de este tipo.

Un PDF escaneado guarda píxeles. Un escáner, la cámara de un móvil o un fax han fotografiado una hoja de papel y han envuelto esa imagen en un contenedor PDF. El archivo no tiene ni idea de que hay palabras encima. Para el software es una sola imagen grande que resulta tener forma de página.

Los dos se abren en el mismo visor y en pantalla se parecen mucho. Todo lo demás es distinto.

02

Cómo comprobarlo

Selecciona una palabra con el cursor. El texto se resalta palabra por palabra y sigue la línea. Un escaneo te da un rectángulo sobre toda la imagen, o nada.

Busca una palabra que estés viendo. Ctrl+F, la escribes, Intro. Si no aparece ningún resultado para una palabra que está claramente en la página, es concluyente: no hay capa de texto.

Mira el tamaño del archivo. Veinte páginas en 200 KB son texto. Veinte páginas en 25 MB son escaneos.

Amplía mucho. El texto se mantiene nítido al 400% porque se vuelve a dibujar en cada nivel de zoom. Un escaneo se convierte en píxeles visibles o en una papilla de JPEG.

03

Por qué importa

Decide qué es posible. No puedes buscar, copiar ni convertir a Word un escaneo en ningún sentido real, porque no hay nada en el archivo que buscar, copiar o convertir. Las herramientas que parecen hacerlo están ejecutando OCR antes, lo digan o no.

También decide el tamaño del archivo, como acabamos de ver, y decide la accesibilidad: un lector de pantalla puede leer en voz alta un PDF de texto y no puede hacer absolutamente nada con un escaneo. Si un documento tiene que ser accesible, esto es lo primero que hay que comprobar, no lo último.

Buscar y copiar
Solo con texto. Un escaneo necesita OCR antes de que cualquiera de las dos cosas funcione.
Convertir a Word o Excel
El texto se convierte directamente. Un escaneo se convierte solo tan bien como el OCR haya leído la página.
Tamaño del archivo
El texto es pequeño y sigue siéndolo. Los escaneos son grandes y solo la compresión ayuda.
Lectores de pantalla
El texto se puede leer en voz alta. Un escaneo es mudo.

04

Convertir un escaneo en texto

El OCR — reconocimiento óptico de caracteres — mira la imagen y deduce qué letras está viendo. Aplicado sobre un PDF escaneado, añade una capa de texto invisible detrás de la imagen, así que la página se ve exactamente igual que antes pero ya se puede buscar, seleccionar y convertir.

Es un proceso de lectura, no una conversión, así que nunca es perfecto. El texto impreso limpio, recto y a 300 PPP se lee con mucha precisión. Las fotocopias desvaídas, las columnas apretadas, las tipografías raras y la letra manuscrita se leen mal o no se leen. Revisa el resultado antes de fiarte de él, sobre todo con los números, donde un dígito mal leído resulta perfectamente creíble.

Preguntas

Preguntas relacionadas

¿Puedo hacer que un PDF escaneado sea buscable sin cambiar su aspecto?

Sí, y es la forma normal de aplicar el OCR. El texto reconocido se coloca en una capa invisible situada detrás de la imagen original, así que la página que ves queda intacta mientras la búsqueda, la selección y el copiado empiezan a funcionar.

Mi PDF se deja seleccionar en unas páginas y en otras no. ¿Qué pasa?

Es un archivo mixto: unas páginas se generaron como texto y otras se escanearon y se insertaron. Es muy habitual en contratos firmados, donde solo la hoja de la firma pasó por un escáner. Pasar el OCR por todo el documento es inofensivo: las páginas que ya tienen texto se quedan como están.

¿El OCR cambia mi texto original?

No. El OCR añade una capa, no sustituye nada. Si el reconocimiento sale mal, la página de debajo sigue siendo exactamente el escaneo del que partiste.