D'un PDF numérisé à un fichier Word modifiable : une liste de contrôle pour l'OCR
Si, en faisant glisser le curseur sur une phrase dans un PDF, vous sélectionnez une image rectangulaire au lieu de mots, il se peut que la page soit issue d’une numérisation. La reconnaissance optique de caractères (OCR) tente de reconnaître ces lettres numérisées. Cela peut permettre de gagner du temps lors de la transcription, mais doit être suivi d’une relecture.
Commencez par la meilleure numérisation disponible
Utilisez le scan original plutôt qu’une capture d’écran d’un aperçu. Vérifiez que la page entière est visible, que les mots sont à l’endroit et que l’arrière-plan est raisonnablement uniforme. Les ombres prononcées près du dos d’un livre, les pages de travers et les petites lettres compressées rendent la reconnaissance plus difficile. Il est souvent plus rapide de refaire un scan que de corriger des centaines d’erreurs.
Choisissez la langue de reconnaissance
Dans PDF en Word, sélectionnez une sortie modifiable et choisissez la langue du document. Le paramètre de langue permet à la reconnaissance de disposer d’un vocabulaire plus riche ; il ne traduit pas le document. Si une page mélange plusieurs langues, examinez la langue secondaire avec une attention particulière.
Testez brièvement le service avant de vous lancer dans un projet de grande envergure
- Utilisez Extraire des pages pour créer un exemple comprenant une page de texte type et le tableau ou le diagramme le plus complexe.
- Convertissez cet exemple en fichier Word modifiable.
- Comparez un paragraphe ligne par ligne, puis vérifiez une ligne de tableau et un en-tête de page.
- Si la reconnaissance est de mauvaise qualité, améliorez la numérisation avant de traiter l'intégralité du document.
Une mission de relecture qui permet d'éviter des erreurs coûteuses
| Vérifier d'abord | Pourquoi est-ce important ? | Exemple |
|---|---|---|
| Noms et identifiants de référence | Il se peut que le correcteur orthographique ne reconnaisse pas certains termes valides mais inhabituels. | « O » ou « 0 » dans la référence d'une facture |
| Montants et dates | Une petite erreur de caractère peut changer le sens. | 1 250,00 par opposition à 1 250,00 |
| Ordre de lecture | Les colonnes peuvent être fusionnées de manière incorrecte. | La fin de la colonne de gauche est rattachée à un titre de la colonne de droite |
| Négation et ponctuation | Un mot ou un signe manquant peut changer le sens d'une phrase. | Un « pas » ou un signe moins manquant |
Pourquoi un résultat modifiable peut paraître plus simple
L'apparence d'un document numérisé s'exprime en pixels. Un document modifiable nécessite des blocs de texte, des paragraphes et un ordre de lecture. La solution de secours de PDFMaple pour les documents numérisés réorganise le texte reconnu au lieu d'intégrer la page entière comme seul contenu. Vous pourrez ainsi restaurer les titres, les espacements et les tableaux complexes dans votre éditeur Word.
Quand conserver les images des pages à la place
Si le document est principalement composé de schémas, d'écritures manuscrites ou de références visuelles, le mode « préserver l'apparence » peut s'avérer plus utile. Les images des pages conservent la référence visuelle mais ne transforment pas les mots en texte modifiable. Conservez le scan original accompagné de toute transcription corrigée afin qu'un autre lecteur puisse vérifier les passages incertains.
Pour comparer toutes les options de sortie, consultez texte modifiable ou apparence conservée.
Quand un PDF interrogeable suffit
Si vous avez besoin d'effectuer une recherche dans le document sans en modifier la mise en page, essayez OCR PDF Tout d’abord, conservez le PDF interrogeable comme référence visuelle à côté de toute copie Word modifiable.