Convertir un PDF scanné en texte (OCR)
Un formulaire numérisé, un contrat photocopié, une photocopie d'archive : un PDF issu d'un scanner ou d'une photocopieuse ne contient le plus souvent que des images de pages, sans aucun texte réellement présent dans le fichier — impossible d'y chercher un mot, d'en copier un extrait, ou de le faire lire par un lecteur d'écran. Cet outil convertit ce type de PDF en texte brut, en document Word, ou en PDF cherchable qui garde l'apparence du scan tout en devenant indexable.
D'abord, une vérification qui évite un traitement inutile
Avant de lancer quoi que ce soit, l'outil ouvre le PDF et vérifie s'il contient déjà du texte extractible : c'est le cas d'un PDF exporté directement depuis un logiciel de bureautique, ou déjà traité par un autre outil d'OCR en amont. Si du texte est trouvé, il est extrait directement à partir du fichier, sans passer par la reconnaissance d'image — plus rapide, et surtout plus fiable qu'une reconnaissance qui réinterpréterait une image du texte déjà présent tel quel dans le fichier. Un message vous informe quand ce raccourci a été pris. Ce n'est que si aucun texte n'est trouvé — le cas d'un vrai scan, image par image — que le moteur de reconnaissance optique de caractères entre en jeu.
Page par page, avec une progression réelle
Chaque page d'un PDF scanné est d'abord rasterisée à haute résolution (300 points par pouce, la référence pour une reconnaissance fiable), puis traitée individuellement : détection d'une éventuelle rotation à 90, 180 ou 270 degrés (fréquente sur un lot de pages numérisées dans des sens différents), redressement fin de l'inclinaison, débruitage, seuillage, puis reconnaissance des caractères dans la ou les langues que vous avez choisies. La barre de progression avance réellement page par page, pas de façon arbitraire : sur un document de plusieurs dizaines de pages, vous savez à tout moment où en est le traitement.
Trois sorties, un même contenu
Le texte brut rassemble le contenu de toutes les pages dans l'ordre, prêt à être copié. Le document Word ajoute un saut de page entre chaque page source et un paragraphe par bloc de texte détecté, pour rester proche de la structure d'origine tout en restant modifiable. Le PDF cherchable, lui, réutilise l'image de chaque page telle qu'envoyée — cachets, signatures, en-têtes compris — en lui superposant une couche de texte invisible : le document a exactement la même apparence qu'avant, mais devient recherchable et copiable dans n'importe quel lecteur PDF moderne.
Limites de la limite de 20 pages
La limite de 20 pages par traitement n'est pas arbitraire : elle maintient un temps de traitement compatible avec une utilisation interactive (quelques dizaines de secondes plutôt que plusieurs minutes), sur des serveurs partagés entre tous les visiteurs du site. Pour un document plus long, la division en plusieurs PDF de moins de 20 pages avec l'outil de division de PDF, suivie d'un traitement de chaque partie, reste la solution la plus simple.