come capire se un pdf è scansionato
PDF scansionato o PDF di testo? Come capirlo
Prova a selezionare una parola. Se il cursore evidenzia la parola, hai del testo. Se disegna un riquadro sull'intera pagina, hai una fotografia — e quel singolo fatto spiega quasi tutto ciò che un PDF ti lascerà e non ti lascerà fare.
01
I due tipi
Un PDF di testo conserva caratteri. Sa che la pagina contiene la parola "fattura", sa con quale font disegnarla e sa esattamente dove va sulla pagina. Tutto ciò che esce da Word, da un browser, da un gestionale o dall'esportazione di quasi qualsiasi programma è di questo tipo.
Un PDF scansionato conserva pixel. Uno scanner, la fotocamera di un telefono o un fax ha fotografato un foglio di carta e ha avvolto l'immagine risultante in un contenitore PDF. Il file non ha la minima idea che ci siano parole sopra. Per il software è una grande immagine che per caso ha la forma di una pagina.
Entrambi si aprono nello stesso visualizzatore e a schermo si somigliano molto. Tutto il resto è diverso.
02
Come verificarlo
Seleziona una parola con il cursore. Il testo si evidenzia parola per parola e segue la riga. Una scansione ti restituisce un rettangolo sull'intera immagine, oppure nulla.
Cerca una parola che vedi. Ctrl+F, scrivila, invio. Nessun risultato su una parola chiaramente visibile sulla pagina è conclusivo: non esiste uno strato di testo.
Guarda la dimensione del file. Venti pagine in 200 KB sono testo. Venti pagine in 25 MB sono scansioni.
Zooma parecchio. Il testo resta nitido al 400% perché viene ridisegnato a ogni livello di zoom. Una scansione diventa pixel visibili o poltiglia JPEG.
03
Perché conta
Decide che cosa è possibile. Non puoi cercare, copiare o convertire in Word una scansione in nessun senso utile, perché nel file non c'è nulla da cercare, copiare o convertire. Gli strumenti che sembrano riuscirci stanno prima eseguendo l'OCR, che lo dichiarino o meno.
Decide anche la dimensione del file, come sopra, e decide l'accessibilità: uno screen reader legge ad alta voce un PDF di testo e non ricava assolutamente nulla da una scansione. Se un documento deve essere accessibile, è la prima cosa da controllare, non l'ultima.
- Cerca e copia
- Solo testo. Una scansione ha bisogno dell'OCR prima che funzioni l'uno o l'altra.
- Conversione in Word o Excel
- Il testo converte direttamente. Una scansione converte solo quanto bene l'OCR l'ha letta.
- Dimensione del file
- Il testo è piccolo e resta piccolo. Le scansioni sono grandi e aiuta solo la compressione.
- Screen reader
- Il testo può essere letto ad alta voce. Una scansione è muta.
04
Trasformare una scansione in testo
L'OCR — riconoscimento ottico dei caratteri — guarda l'immagine e capisce quali lettere sta vedendo. Applicato a un PDF scansionato, aggiunge uno strato di testo invisibile dietro l'immagine, così la pagina appare esattamente com'era ma ora è ricercabile, selezionabile e convertibile.
È un processo di lettura, non di conversione, quindi non è mai perfetto. Testo stampato pulito, dritto, a 300 DPI viene letto con grande precisione. Fotocopie sbiadite, colonne strette, font insoliti e scrittura a mano vengono letti male o per niente. Controlla il risultato prima di fidartene, soprattutto sui numeri, dove una cifra letta male sembra del tutto plausibile.