Vai al contenuto
PDFLove

come capire se un pdf è scansionato

PDF scansionato o PDF di testo? Come capirlo

Prova a selezionare una parola. Se il cursore evidenzia la parola, hai del testo. Se disegna un riquadro sull'intera pagina, hai una fotografia — e quel singolo fatto spiega quasi tutto ciò che un PDF ti lascerà e non ti lascerà fare.

01

I due tipi

Un PDF di testo conserva caratteri. Sa che la pagina contiene la parola "fattura", sa con quale font disegnarla e sa esattamente dove va sulla pagina. Tutto ciò che esce da Word, da un browser, da un gestionale o dall'esportazione di quasi qualsiasi programma è di questo tipo.

Un PDF scansionato conserva pixel. Uno scanner, la fotocamera di un telefono o un fax ha fotografato un foglio di carta e ha avvolto l'immagine risultante in un contenitore PDF. Il file non ha la minima idea che ci siano parole sopra. Per il software è una grande immagine che per caso ha la forma di una pagina.

Entrambi si aprono nello stesso visualizzatore e a schermo si somigliano molto. Tutto il resto è diverso.

02

Come verificarlo

Seleziona una parola con il cursore. Il testo si evidenzia parola per parola e segue la riga. Una scansione ti restituisce un rettangolo sull'intera immagine, oppure nulla.

Cerca una parola che vedi. Ctrl+F, scrivila, invio. Nessun risultato su una parola chiaramente visibile sulla pagina è conclusivo: non esiste uno strato di testo.

Guarda la dimensione del file. Venti pagine in 200 KB sono testo. Venti pagine in 25 MB sono scansioni.

Zooma parecchio. Il testo resta nitido al 400% perché viene ridisegnato a ogni livello di zoom. Una scansione diventa pixel visibili o poltiglia JPEG.

03

Perché conta

Decide che cosa è possibile. Non puoi cercare, copiare o convertire in Word una scansione in nessun senso utile, perché nel file non c'è nulla da cercare, copiare o convertire. Gli strumenti che sembrano riuscirci stanno prima eseguendo l'OCR, che lo dichiarino o meno.

Decide anche la dimensione del file, come sopra, e decide l'accessibilità: uno screen reader legge ad alta voce un PDF di testo e non ricava assolutamente nulla da una scansione. Se un documento deve essere accessibile, è la prima cosa da controllare, non l'ultima.

Cerca e copia
Solo testo. Una scansione ha bisogno dell'OCR prima che funzioni l'uno o l'altra.
Conversione in Word o Excel
Il testo converte direttamente. Una scansione converte solo quanto bene l'OCR l'ha letta.
Dimensione del file
Il testo è piccolo e resta piccolo. Le scansioni sono grandi e aiuta solo la compressione.
Screen reader
Il testo può essere letto ad alta voce. Una scansione è muta.

04

Trasformare una scansione in testo

L'OCR — riconoscimento ottico dei caratteri — guarda l'immagine e capisce quali lettere sta vedendo. Applicato a un PDF scansionato, aggiunge uno strato di testo invisibile dietro l'immagine, così la pagina appare esattamente com'era ma ora è ricercabile, selezionabile e convertibile.

È un processo di lettura, non di conversione, quindi non è mai perfetto. Testo stampato pulito, dritto, a 300 DPI viene letto con grande precisione. Fotocopie sbiadite, colonne strette, font insoliti e scrittura a mano vengono letti male o per niente. Controlla il risultato prima di fidartene, soprattutto sui numeri, dove una cifra letta male sembra del tutto plausibile.

Domande

Domande collegate

Posso rendere ricercabile un PDF scansionato senza cambiarne l'aspetto?

Sì, ed è il modo normale in cui si applica l'OCR. Il testo riconosciuto viene collocato in uno strato invisibile posizionato dietro l'immagine originale, quindi la pagina che vedi resta intatta mentre ricerca, selezione e copia iniziano a funzionare.

Il mio PDF è in parte selezionabile e in parte no. Che succede?

È un file misto — alcune pagine sono state generate come testo e altre sono state scansionate e inserite, cosa molto comune nei contratti firmati, dove solo la pagina delle firme è passata dallo scanner. Eseguire l'OCR sull'intero documento è innocuo: le pagine che hanno già del testo vengono lasciate stare.

L'OCR modifica il mio testo originale?

No. L'OCR aggiunge uno strato invece di sostituire qualcosa. Se il riconoscimento viene male, la pagina sottostante è ancora esattamente la scansione da cui sei partito.