Convertir un PDF scanné en texte (OCR)

Un formulaire numérisé, un contrat photocopié, une photocopie d'archive : un PDF issu d'un scanner ou d'une photocopieuse ne contient le plus souvent que des images de pages, sans aucun texte réellement présent dans le fichier — impossible d'y chercher un mot, d'en copier un extrait, ou de le faire lire par un lecteur d'écran. Cet outil convertit ce type de PDF en texte brut, en document Word, ou en PDF cherchable qui garde l'apparence du scan tout en devenant indexable.

D'abord, une vérification qui évite un traitement inutile

Avant de lancer quoi que ce soit, l'outil ouvre le PDF et vérifie s'il contient déjà du texte extractible : c'est le cas d'un PDF exporté directement depuis un logiciel de bureautique, ou déjà traité par un autre outil d'OCR en amont. Si du texte est trouvé, il est extrait directement à partir du fichier, sans passer par la reconnaissance d'image — plus rapide, et surtout plus fiable qu'une reconnaissance qui réinterpréterait une image du texte déjà présent tel quel dans le fichier. Un message vous informe quand ce raccourci a été pris. Ce n'est que si aucun texte n'est trouvé — le cas d'un vrai scan, image par image — que le moteur de reconnaissance optique de caractères entre en jeu.

Page par page, avec une progression réelle

Chaque page d'un PDF scanné est d'abord rasterisée à haute résolution (300 points par pouce, la référence pour une reconnaissance fiable), puis traitée individuellement : détection d'une éventuelle rotation à 90, 180 ou 270 degrés (fréquente sur un lot de pages numérisées dans des sens différents), redressement fin de l'inclinaison, débruitage, seuillage, puis reconnaissance des caractères dans la ou les langues que vous avez choisies. La barre de progression avance réellement page par page, pas de façon arbitraire : sur un document de plusieurs dizaines de pages, vous savez à tout moment où en est le traitement.

Trois sorties, un même contenu

Le texte brut rassemble le contenu de toutes les pages dans l'ordre, prêt à être copié. Le document Word ajoute un saut de page entre chaque page source et un paragraphe par bloc de texte détecté, pour rester proche de la structure d'origine tout en restant modifiable. Le PDF cherchable, lui, réutilise l'image de chaque page telle qu'envoyée — cachets, signatures, en-têtes compris — en lui superposant une couche de texte invisible : le document a exactement la même apparence qu'avant, mais devient recherchable et copiable dans n'importe quel lecteur PDF moderne.

Limites de la limite de 20 pages

La limite de 20 pages par traitement n'est pas arbitraire : elle maintient un temps de traitement compatible avec une utilisation interactive (quelques dizaines de secondes plutôt que plusieurs minutes), sur des serveurs partagés entre tous les visiteurs du site. Pour un document plus long, la division en plusieurs PDF de moins de 20 pages avec l'outil de division de PDF, suivie d'un traitement de chaque partie, reste la solution la plus simple.

Preguntas frecuentes

Comment savoir si mon PDF est déjà cherchable ?
Ouvrez-le dans un lecteur PDF et essayez de sélectionner du texte à la souris : si un mot se surligne, le PDF contient déjà une couche de texte et l'OCR n'apporterait rien. Cet outil fait cette vérification automatiquement à votre place : si du texte est détecté, il l'extrait directement, sans passer par la reconnaissance d'image, ce qui est plus rapide et plus fiable.
Combien de pages puis-je traiter en une fois ?
20 pages maximum par PDF. Cette limite existe pour garder un temps de traitement raisonnable côté serveur ; pour un document plus long, divisez-le d'abord avec l'outil de division de PDF.
Combien de temps prend le traitement d'un PDF de plusieurs pages ?
Chaque page est traitée l'une après l'autre (rasterisation, redressement, reconnaissance), avec une progression affichée en temps réel. Un PDF scanné de 10 pages de qualité correcte se traite typiquement en moins d'une minute.
Le résultat conserve-t-il la mise en page du PDF d'origine ?
Le PDF cherchable conserve exactement l'apparence visuelle du scan d'origine, page par page. Le texte brut et le document Word, eux, ne reconstituent que le contenu textuel dans son ordre de lecture, sans les mises en page complexes (colonnes multiples, tableaux, encadrés).
Mon PDF scanné contient des pages tournées à 90°, est-ce un problème ?
Non, l'outil détecte et corrige automatiquement une page à l'envers ou tournée d'un quart de tour, page par page — un cas fréquent avec un scanner qui numérise indifféremment le recto et le verso d'un carnet.
Puis-je océriser un PDF protégé par mot de passe ?
Non, retirez d'abord le mot de passe avec l'outil de protection PDF (fonction "retirer un mot de passe connu"), qui exige de le connaître : cet outil ne tente jamais de contourner une protection.
Que veut dire le score de confiance affiché pour chaque page ?
C'est la confiance moyenne du moteur de reconnaissance sur les mots détectés de cette page, de 0 à 100 %. En dessous de 60 %, la page mérite d'être vérifiée manuellement : le texte reconnu peut contenir des erreurs, en particulier sur un scan de mauvaise qualité ou un document ancien.
Le fichier PDF envoyé est-il conservé ?
Non, ni le PDF envoyé ni les documents produits ne sont conservés au-delà de 30 minutes : aucune donnée n'est journalisée ni réutilisée, et vous pouvez déclencher la suppression immédiate dès que vous avez récupéré votre résultat.