PDF en TXT

Extraire le texte d'un PDF. Directement dans votre navigateur. 100 % gratuit, confidentialité protégée.

PDF en TXT extrait le contenu textuel d'un PDF dans un fichier texte brut, en supprimant la mise en page, les polices et les images afin qu'il ne reste que les mots. C'est exactement ce qu'il vous faut lorsque le texte doit être introduit dans un script, un outil d'analyse, un flux de travail de traduction ou un index de recherche, où la structure PDF ne ferait qu'entraver. L'extraction préserve l'ordre de lecture et les sauts de paragraphe dans la mesure où le document source le permet. Il s'exécute dans votre navigateur sans aucun téléchargement.

  1. Télécharger — Faites glisser et déposez vos fichiers dans la zone de téléchargement, ou cliquez pour parcourir et sélectionner des fichiers depuis votre appareil.
  2. Configurer — Extraire le texte d'un PDF
  3. Télécharger — Cliquez sur le bouton de téléchargement pour enregistrer votre fichier traité. Il est prêt instantanément !

Foire aux questions

Fonctionne-t-il sur les PDF numérisés ?

Non. Un scan contient des images de texte, pas du texte. Traitez-le d'abord avec un OCR, qui reconnaît les caractères et ajoute une véritable couche de texte.

La mise en page est-elle préservée ?

Non, et c'est délibéré — le texte brut n'a pas de colonnes ni de positionnement. Les mises en page à plusieurs colonnes, en particulier, sont aplaties en un ordre de lecture unique.

Quel est l'encodage de la sortie ?

UTF-8, afin que les caractères accentués et les scripts non latins restent intacts.

Pourquoi du texte est-il manquant ?

Généralement parce que certaines parties de la page sont des images plutôt que du texte, ou que le PDF utilise une police avec une carte de caractères corrompue. L'OCR gère le premier cas.

Convert