Aller au contenu
PDFLove

comment savoir si un pdf est scanné

PDF numérisé ou PDF texte ? Comment le savoir

Essayez de sélectionner un mot. Si le curseur attrape le mot, vous avez du texte. S'il dessine un cadre sur toute la page, vous avez une photographie — et ce seul fait explique l'essentiel de ce qu'un PDF vous laissera et ne vous laissera pas faire.

01

Les deux sortes

Un PDF texte stocke des caractères. Il sait que la page contient le mot « facture », il sait dans quelle police le dessiner, et il sait exactement où il se place sur la page. Tout ce qui sort de Word, d'un navigateur, d'un logiciel de comptabilité ou de l'export de à peu près n'importe quel programme est de cette sorte.

Un PDF numérisé stocke des pixels. Un scanner, l'appareil photo d'un téléphone ou un télécopieur a photographié une feuille de papier et a emballé l'image obtenue dans un conteneur PDF. Le fichier n'a aucune idée qu'il y a des mots dessus. Pour le logiciel, c'est une grande image qui a par hasard la forme d'une page.

Les deux s'ouvrent dans la même visionneuse et se ressemblent beaucoup à l'écran. Tout le reste diffère.

02

Comment vérifier

Sélectionnez un mot avec le curseur. Le texte se surligne mot par mot et suit la ligne. Une numérisation vous donne un rectangle sur toute l'image, ou rien.

Cherchez un mot que vous voyez. Ctrl+F, tapez-le, entrée. Aucun résultat sur un mot clairement visible sur la page est concluant : il n'y a pas de couche de texte.

Regardez la taille du fichier. Vingt pages en 200 Ko, c'est du texte. Vingt pages en 25 Mo, ce sont des numérisations.

Zoomez fort. Le texte reste net à 400 % parce qu'il est redessiné à chaque niveau de zoom. Une numérisation se transforme en pixels visibles ou en bouillie JPEG.

03

Pourquoi cela compte

Cela décide de ce qui est possible. Vous ne pouvez ni rechercher, ni copier, ni convertir une numérisation en Word dans un sens utile, parce qu'il n'y a rien dans le fichier à rechercher, copier ou convertir. Les outils qui semblent y parvenir exécutent d'abord une OCR, qu'ils le disent ou non.

Cela décide aussi de la taille du fichier, comme ci-dessus, et de l'accessibilité : un lecteur d'écran lit un PDF texte à voix haute et ne tire absolument rien d'une numérisation. Si un document doit être accessible, c'est la première chose à vérifier, pas la dernière.

Recherche et copie
Texte uniquement. Une numérisation a besoin d'une OCR avant que l'un ou l'autre fonctionne.
Conversion en Word ou Excel
Le texte se convertit directement. Une numérisation ne se convertit qu'à hauteur de ce que l'OCR a lu.
Taille du fichier
Le texte est petit et le reste. Les numérisations sont lourdes et seule la compression aide.
Lecteurs d'écran
Le texte peut être lu à voix haute. Une numérisation est muette.

04

Transformer une numérisation en texte

L'OCR — reconnaissance optique de caractères — regarde l'image et détermine quelles lettres elle voit. Appliquée à un PDF numérisé, elle ajoute une couche de texte invisible derrière l'image, si bien que la page a exactement la même allure mais devient interrogeable, sélectionnable et convertible.

C'est un processus de lecture, pas de conversion, il n'est donc jamais parfait. Un texte imprimé propre, droit, à 300 PPP est lu avec une grande précision. Les photocopies pâles, les colonnes serrées, les polices inhabituelles et l'écriture manuscrite sont mal lues, voire pas du tout. Vérifiez le résultat avant de vous y fier, en particulier sur les chiffres, où un chiffre mal lu paraît tout à fait plausible.

Questions

Questions liées

Puis-je rendre un PDF numérisé interrogeable sans changer son apparence ?

Oui, et c'est la manière habituelle d'appliquer l'OCR. Le texte reconnu est placé dans une couche invisible positionnée derrière l'image d'origine : la page que vous voyez reste intacte tandis que la recherche, la sélection et la copie se mettent à fonctionner.

Mon PDF est sélectionnable par endroits et pas ailleurs. Que se passe-t-il ?

C'est un fichier mixte — certaines pages ont été générées comme du texte, d'autres numérisées puis insérées, ce qui est très courant dans les contrats signés où seule la page de signature est passée au scanner. Passer l'OCR sur tout le document est sans danger : les pages qui ont déjà du texte sont laissées telles quelles.

L'OCR modifie-t-elle mon texte d'origine ?

Non. L'OCR ajoute une couche plutôt que de remplacer quoi que ce soit. Si la reconnaissance est mauvaise, la page sous-jacente reste exactement la numérisation de départ.