Extraire le texte d'un PDF : texte intégré, scans et OCR

Savoir quand une extraction directe fonctionne, quand il faut un OCR et comment contrôler le résultat.

Le moyen le plus rapide d’extraire du texte d’un PDF est d’utiliser le texte qui se trouve déjà dans le fichier. Un PDF consultable, un rapport exporté ou une numérisation traitée par OCR contient généralement des objets texte qu’un lecteur peut sélectionner et copier. Ce n’est pas le cas d’une numérisation d’image uniquement : il s’agit d’une image enveloppée dans un PDF, donc un extracteur de texte ne retournera que peu ou rien jusqu’à ce qu’une étape OCR crée un calque de texte.

L’outil PDF vers texte de Lutrakit convient au premier cas. Il s’exécute dans le navigateur, lit un PDF à la fois et écrit un fichier .txt sans envoyer le document à un serveur. Ce n’est pas un moteur OCR. Si la page est une numérisation, utilisez d’abord Redresser un PDF ou une autre étape de prétraitement locale, puis exécutez l’OCR dans un logiciel conçu pour la reconnaissance.

Tout d’abord, décidez du type de PDF dont vous disposez

Ouvrez le PDF dans un lecteur et essayez trois vérifications :

  1. Pouvez-vous sélectionner par glisser-déposer une phrase du corps du texte ?
  2. Ctrl+F ou Cmd+F trouve-t-il un mot visible sur la page ?
  3. Lorsque vous copiez un paragraphe dans un éditeur de texte brut, les mots sont-ils pour la plupart corrects ?

Si les trois fonctionnent, le PDF contient probablement du texte intégré. Si la page semble normale mais que la sélection dessine un rectangle sur l’image de la page, il s’agit probablement d’une image uniquement. Si la recherche fonctionne mais que le texte copié comporte des lettres erronées ou des sauts de ligne étranges, il peut s’agir d’une numérisation traitée par OCR avec une couche de texte cachée défectueuse.

Cette distinction est importante car les API d’extraction de texte PDF renvoient le contenu textuel du fichier, et non une nouvelle lecture visuelle de la page. L’API PDF.js getTextContent() de Mozilla, qui est utilisée pour l’extraction de texte PDF côté navigateur, résout le contenu du texte de la page et normalise les espaces en espaces ordinaires (API PDF.js, consulté le 17/08/2026). Il ne peut pas inventer des mots à partir de pixels. La FAQ PDF/A de la PDF Association définit clairement la même limite pour les documents numérisés : l’OCR est ce qui rend les pages numérisées consultables, généralement en ajoutant du texte invisible à la page (PDF Association PDF/A FAQ, consulté le 17/08/2026).

L’outil PDF vers texte avant la sélection du document
Les libellés de la capture sont en anglais. L’interface française reprend le même sélecteur de PDF et les mêmes limites.

Utilisez Lutrakit pour le texte intégré

Suivez ces étapes si les vérifications de sélection et de recherche réussissent :

  1. Ouvrez PDF vers texte.
  2. Déposez un fichier PDF. La limite actuelle est de 100 Mo par fichier.
  3. Désactivez “pages séparées” pour un fichier texte continu, ou activez-le pour repérer les changements de page.
  4. Définissez un nom de sortie tel que contract-extracted.
  5. Exécutez l’outil et téléchargez le résultat .txt.

L’option de séparateur de page est utile pour les factures, formulaires, procès-verbaux et tout ce dont une page manquante constituerait une erreur grave. Elle insère des en-têtes de page simples afin que vous puissiez rechercher Page 7 dans le fichier texte et le comparer avec la page 7 du PDF.

Un exemple reproductible de trois pages

Pour vérifier les trois cas, créez un PDF d’essai sans données privées que vous pouvez partager. Il doit contenir les trois pages suivantes. Le tableau indique les résultats attendus, pas ceux d’une exécution déjà réalisée :

Pages Exemple de contenu Extraction attendue
1 Texte numérique exporté : “Facture A-1024, total 148,60 EUR” Les mêmes mots et chiffres apparaissent dans le fichier .txt.
2 Notes de réunion sur deux colonnes Le texte apparaît, mais l’ordre de lecture doit être vérifié colonne par colonne.
3 Une image numérisée de la phrase « Signée le 17 août 2026 » Sortie vide ou presque vide, sauf si le texte OCR a déjà été ajouté.

Notez le navigateur, le système d’exploitation, le fichier utilisé, le texte attendu, le texte obtenu et chaque différence. Conservez le PDF d’essai avec la sortie pour pouvoir comparer une autre exécution.

Pourquoi l’ordre de lecture peut être erroné

Le PDF stocke les instructions de dessin. Une page peut ressembler à un paragraphe normal tandis que les objets texte sont stockés sous forme de séquences distinctes, de mots positionnés, de colonnes, d’en-têtes, de pieds de page ou de glyphes à partir d’une police personnalisée. Un extracteur de texte suit le contenu qu’il reçoit ; il n’a pas le jugement d’une personne qui lit une mise en page.

Symptômes courants :

  • Les en-têtes et pieds de page apparaissent au milieu du corps du texte.
  • Une page à deux colonnes alterne les lignes de colonne de gauche et de droite.
  • Les ligatures ou les polices personnalisées produisent des caractères erronés.
  • Les écritures japonaises ou autres sans espaces peuvent être mal séparées si les passages de texte du PDF ne correspondent pas à des limites de mots.
  • Les numérisations traitées par OCR incluent des caractères plausibles mais erronés, tels que O pour 0 ou l pour 1.

Pour tout ce qui est juridique, académique, financier ou archivistique, traitez le fichier extrait comme un brouillon à vérifier, et non comme une preuve.

Que faire des numérisations

Si le PDF contient uniquement des images, l’extraction de texte n’est pas le bon premier outil. Améliorez l’image de la page, puis appliquez l’OCR :

  1. Redressez les pages inclinées. Le guide qualité de Tesseract indique que l’inclinaison nuit à la segmentation des lignes et recommande de faire pivoter la page jusqu’à ce que les lignes de texte soient horizontales (Tesseract Améliorer la qualité, consulté le 17/08/2026).
  2. Préférez des numérisations nettes et de haute résolution. Le même guide Tesseract indique qu’une résolution de 300 DPI ou plus peut améliorer la qualité de la reconnaissance.
  3. Rognez les bordures noires et conservez une marge blanche raisonnable.
  4. Exécutez l’OCR localement ou dans un outil OCR fiable, puis utilisez PDF vers texte sur le PDF traité par OCR si vous avez besoin d’une simple copie .txt.

L’outil Redresser un PDF de Lutrakit peut vous aider à l’étape 1 pour les PDF et les images numérisées courantes, mais il n’ajoute pas de texte OCR. Une numérisation plus nette peut améliorer la reconnaissance ultérieure ; le redressement seul ne la rend pas consultable par recherche textuelle.

Vérifiez le résultat

Utilisez un petit audit au lieu de lire aveuglément l’ensemble du résultat :

  • Comptez les pages : si la source a 12 pages et que le fichier texte n’affiche que 11 sections de page, arrêtez.
  • Recherchez une phrase ou un numéro unique par page importante.
  • Comparez les totaux, les dates, les noms et les identifiants avec le PDF, pas avec la mémoire.
  • Pour les pages à deux colonnes, vérifiez l’ordre d’au moins une section complète.
  • Pour les numérisations OCR, lisez visuellement chaque caractère critique dans le PDF.

Si le fichier texte alimente un autre système, conservez le PDF à côté. Le fichier .txt est plus facile à rechercher ; le PDF reste la source visuelle de vérité.

Limites et quand ne pas utiliser cette méthode

N’utilisez pas PDF vers texte comme seule étape lorsque le PDF est une mauvaise numérisation, un échantillon d’écriture manuscrite, un rapport contenant beaucoup de tableaux, un formulaire où les cases à cocher sont importantes ou un document où la mise en page exacte est une preuve. Utilisez un flux de travail OCR/analyse de documents dédié ou une application PDF de bureau lorsque vous avez besoin d’une reconnaissance fiable, d’une reconstruction de tableaux, de caviardage, de signatures, de balises d’accessibilité ou d’enregistrements de conformité.

Lutrakit est utile lorsque la tâche est simple : transformer un texte déjà intégré en un fichier texte local et le vérifier vous-même. Cette limite réservée au navigateur fait partie du produit : les octets du PDF restent sur votre appareil et la sortie est téléchargée à partir de la session du navigateur.