Extraire le texte d’un PDF
Récupérez le texte d’un document en .txt, dans l’ordre où il se lit.
Traité sur cet appareil · aucun envoi de fichier
PDFVous pouvez aussi coller (Ctrl+V)Confortable jusqu’à 200 Mo
1,7 Mo à télécharger la première fois, puis conservé sur cet appareil.détails
Moteur : pdf.js · plus 140 ko de police de substitution si le document n’embarque pas la sienne.
À quoi sert cette page
Copier-coller depuis un lecteur de PDF donne souvent un texte haché, avec des césures en plein mot et des colonnes mélangées — quand le bouton « copier » n’est pas purement et simplement désactivé. Cette page relit le document et reconstruit ses lignes et ses paragraphes à partir de la position réelle des mots, puis vous rend un .txt propre. Le fichier ne quitte pas votre navigateur, ce qui compte : un PDF dont on extrait le texte est presque toujours un contrat, un relevé ou un rapport.
On dit aussi : extraire le texte d'un pdf, copier le texte d'un pdf, pdf en texte brut.
Comment faire
- Déposez le PDF — ou plusieurs, ils seront traités l’un après l’autre.
- Indiquez les pages si vous n’en voulez qu’une partie, et cochez « deux colonnes » si le document est mis en pages ainsi.
- Lancez, puis téléchargez le fichier texte.
Questions fréquentes
L’outil dit que mon PDF est un scan. Qu’est-ce que cela veut dire ?
Que chaque page est une image, pas du texte. C’est le cas de tout document passé au scanner ou photographié : à l’écran on lit des mots, mais le fichier ne contient que des pixels. Même votre lecteur de PDF ne peut pas y sélectionner un mot. Pour en tirer du texte il faut une reconnaissance de caractères (OCR), que cet outil ne fait pas et que le site ne propose pas encore.
Pourquoi les colonnes de mon article sont-elles mélangées ?
Parce que sans indication, l’outil lit la page de haut en bas, ligne par ligne — et une ligne traverse alors les deux colonnes. Cochez « ce document est mis en pages sur deux colonnes » et relancez : la colonne de gauche sera lue en entier, puis celle de droite. Si vous ne l’aviez pas coché, l’outil vous signale de lui-même les pages où il a vu une gouttière.
Les tableaux sont-ils conservés ?
Non, et c’est une limite du format de sortie plus que de l’extraction : un fichier texte n’a pas de colonnes. Les cellules d’une même ligne se retrouvent les unes à la suite des autres, séparées par des espaces. Un tableau complexe en ressort donc difficilement exploitable.
Comment extraire seulement quelques pages ?
Écrivez-les dans le champ « pages à lire », avec la même syntaxe que partout sur le site : « 1-3, 5, 8-fin ». Les mots « paires » et « impaires » fonctionnent aussi. Laissé vide, le champ prend tout le document.
Et si je veux plutôt une image de chaque page ?
C’est « convertir un PDF en images » qu’il vous faut : il redessine chaque page telle qu’elle s’affiche, mise en page comprise, en PNG ou en JPEG.
Bon à savoir
- L’outil récupère le texte que le PDF contient déjà. Un document scanné — une photo de page — n’en contient aucun : il est alors refusé avec un message clair, plutôt que de rendre un fichier vide.
- L’ordre de lecture est reconstruit à partir de la position des mots sur la page. Sur un texte qui coule d’un seul tenant, il est fidèle ; sur deux colonnes, cochez le réglage prévu — sinon l’outil vous prévient qu’il a vu une gouttière.
- Un tableau ressort ligne par ligne, sans ses colonnes : le .txt n’a pas de cellules. Pour un tableau exploitable, il faut un autre format que celui-ci.
- La mise en forme n’est pas conservée : ni gras, ni italique, ni taille de police, ni couleur. C’est ce que « texte brut » veut dire.
- Les en-têtes et pieds de page sont du texte comme un autre : ils ressortent à chaque page. Le numéro de page aussi.
- Un PDF protégé par mot de passe doit être déverrouillé avant que son texte soit lisible.