Comment rendre un PDF numérisé consultable grâce à la reconnaissance optique de caractères (OCR)
Pour rendre un PDF numérisé consultable, ajoutez une couche de texte OCR, puis vérifiez que la recherche permet de retrouver les mots visibles sur la page. Il n’est pas nécessaire de convertir le document au format Word uniquement pour pouvoir y effectuer une recherche. Un PDF interrogeable conserve la numérisation comme référence visuelle et ajoute le texte reconnu en arrière-plan.
Vérifiez si le PDF est bien une numérisation
Ouvrez une page contenant une phrase claire. Essayez de sélectionner quelques mots, puis recherchez un mot caractéristique dans cette phrase. Si la sélection inclut une image ou si la recherche ne donne aucun résultat, la page ne contient peut-être qu'une image. Testez plusieurs pages : une archive peut contenir une page de garde numérique suivie de pièces jointes numérisées.
Le fait de pouvoir sélectionner du texte ne prouve pas que celui-ci soit correct. Les OCR plus anciens peuvent contenir des lettres erronées ou un ordre de lecture incorrect. Comparez une phrase sélectionnée avec le scan visible avant de décider que le calque existant est utilisable.
Rendez le PDF interrogeable dans PDFMaple
- Ouvrir OCR PDF et choisissez le PDF d'origine, d'une taille maximale de 20 Mo et de 20 pages.
- Sélectionnez « Analyser le PDF ». PDFMaple vérifie quelles pages contiennent du texte avant de lancer la reconnaissance optique de caractères (OCR).
- Si une reconnaissance est nécessaire, choisissez l’anglais, le français ou les deux en fonction du document imprimé. Ce choix permet de reconnaître le texte ; il ne le traduit pas.
- Lancez la reconnaissance et attendez qu'elle soit terminée. Téléchargez le PDF interrogeable.
- Ouvrez le fichier téléchargé, recherchez un mot connu et vérifiez plusieurs phrases sélectionnées.
Les pages contenant déjà du texte sont conservées. Un en-tête de page peu fourni peut être considéré comme du texte existant ; il convient donc de vérifier tout particulièrement les pages combinant un titre saisi au clavier et une pièce jointe photographiée. Si l'original est encore sur papier, utilisez Numériser en PDF pour le photographier et le redresser au préalable.
Quels sont les changements à apporter au sein du document ?
La page visible et le texte reconnu ont des fonctions différentes. L’image montre ce qui a été numérisé. La couche de texte invisible permet la sélection et la recherche. Une reconnaissance erronée du montant n’altère pas nécessairement le montant figurant sur la page, mais elle peut avoir une incidence sur un passage copié, un résultat de recherche ou une conversion ultérieure.
Par exemple, un scan peut clairement afficher une référence de facture se terminant par « O8 », alors que sa couche de texte contient « 08 ». Vérifiez les identifiants, les dates, les totaux et les signes négatifs avant d’utiliser le texte extrait dans un autre système. Pour les documents sensibles, conservez le scan d’origine avec le résultat vérifié.
Lorsque la reconnaissance nécessite une source de meilleure qualité
Le flou, les reflets, les ombres trop marquées et le texte minuscule résultant de la compression ne peuvent pas être corrigés de manière fiable par l’OCR. Essayez d’effectuer une numérisation plus nette avant de traiter à plusieurs reprises la même image de mauvaise qualité. Les paragraphes imprimés constituent généralement un support plus adapté que l’écriture manuscrite, les lettrages décoratifs ou les tableaux très chargés. Suivez les Liste de contrôle de la qualité de l'OCR par numérisation depuis un téléphone lorsque vous pourrez récupérer la page.
Choisissez la prochaine étape
Privilégiez les PDF interrogeables lorsque vous avez principalement besoin de rechercher ou de copier des informations. Utilisez PDF en Word lorsque vous avez besoin de paragraphes modifiables, et vérifiez la mise en page après la conversion. Pour un aperçu, Résumé de PDF par IA Ce site peut vous aider à lire certaines pages, mais vérifiez ses informations par rapport au document original.