comment savoir si un pdf est scanné
PDF numérisé ou PDF texte ? Comment le savoir
Essayez de sélectionner un mot. Si le curseur attrape le mot, vous avez du texte. S'il dessine un cadre sur toute la page, vous avez une photographie — et ce seul fait explique l'essentiel de ce qu'un PDF vous laissera et ne vous laissera pas faire.
01
Les deux sortes
Un PDF texte stocke des caractères. Il sait que la page contient le mot « facture », il sait dans quelle police le dessiner, et il sait exactement où il se place sur la page. Tout ce qui sort de Word, d'un navigateur, d'un logiciel de comptabilité ou de l'export de à peu près n'importe quel programme est de cette sorte.
Un PDF numérisé stocke des pixels. Un scanner, l'appareil photo d'un téléphone ou un télécopieur a photographié une feuille de papier et a emballé l'image obtenue dans un conteneur PDF. Le fichier n'a aucune idée qu'il y a des mots dessus. Pour le logiciel, c'est une grande image qui a par hasard la forme d'une page.
Les deux s'ouvrent dans la même visionneuse et se ressemblent beaucoup à l'écran. Tout le reste diffère.
02
Comment vérifier
Sélectionnez un mot avec le curseur. Le texte se surligne mot par mot et suit la ligne. Une numérisation vous donne un rectangle sur toute l'image, ou rien.
Cherchez un mot que vous voyez. Ctrl+F, tapez-le, entrée. Aucun résultat sur un mot clairement visible sur la page est concluant : il n'y a pas de couche de texte.
Regardez la taille du fichier. Vingt pages en 200 Ko, c'est du texte. Vingt pages en 25 Mo, ce sont des numérisations.
Zoomez fort. Le texte reste net à 400 % parce qu'il est redessiné à chaque niveau de zoom. Une numérisation se transforme en pixels visibles ou en bouillie JPEG.
03
Pourquoi cela compte
Cela décide de ce qui est possible. Vous ne pouvez ni rechercher, ni copier, ni convertir une numérisation en Word dans un sens utile, parce qu'il n'y a rien dans le fichier à rechercher, copier ou convertir. Les outils qui semblent y parvenir exécutent d'abord une OCR, qu'ils le disent ou non.
Cela décide aussi de la taille du fichier, comme ci-dessus, et de l'accessibilité : un lecteur d'écran lit un PDF texte à voix haute et ne tire absolument rien d'une numérisation. Si un document doit être accessible, c'est la première chose à vérifier, pas la dernière.
- Recherche et copie
- Texte uniquement. Une numérisation a besoin d'une OCR avant que l'un ou l'autre fonctionne.
- Conversion en Word ou Excel
- Le texte se convertit directement. Une numérisation ne se convertit qu'à hauteur de ce que l'OCR a lu.
- Taille du fichier
- Le texte est petit et le reste. Les numérisations sont lourdes et seule la compression aide.
- Lecteurs d'écran
- Le texte peut être lu à voix haute. Une numérisation est muette.
04
Transformer une numérisation en texte
L'OCR — reconnaissance optique de caractères — regarde l'image et détermine quelles lettres elle voit. Appliquée à un PDF numérisé, elle ajoute une couche de texte invisible derrière l'image, si bien que la page a exactement la même allure mais devient interrogeable, sélectionnable et convertible.
C'est un processus de lecture, pas de conversion, il n'est donc jamais parfait. Un texte imprimé propre, droit, à 300 PPP est lu avec une grande précision. Les photocopies pâles, les colonnes serrées, les polices inhabituelles et l'écriture manuscrite sont mal lues, voire pas du tout. Vérifiez le résultat avant de vous y fier, en particulier sur les chiffres, où un chiffre mal lu paraît tout à fait plausible.