Extraire les liens d’un texte

Toutes les URL d’un document, dédoublonnées, en liste ou en tableau.

Traité sur cet appareil · aucun envoi de fichier

TXTMDMARKDOWNCSVLOGHTML+3Vous pouvez aussi coller du texte ou un fichier (Ctrl+V)Confortable jusqu’à 30 Mo par fichier

Aucun téléchargement : tout se passe dans cette page.détails

Cet outil n’utilise aucun moteur à télécharger — son code est déjà dans la page.

À quoi sert cette page

Une note de réunion pleine d’adresses, un export de messagerie, un article enregistré en texte : les liens y sont, éparpillés, collés à la ponctuation, parfois répétés dix fois. Les récupérer un par un à la souris est fastidieux et on en oublie toujours. Cette page les rassemble tous, retire la ponctuation qui n’appartient pas à l’adresse, les dédoublonne, et vous rend une liste propre ou un tableau avec le domaine et le nombre d’occurrences.

On dit aussi : extraire les liens d'un texte, récupérer toutes les urls.

Comment faire

  1. Déposez le fichier texte, Markdown ou HTML qui contient les liens.
  2. Choisissez l’ordre, et si vous voulez la liste des adresses ou celle des domaines.
  3. Téléchargez la liste ou le CSV — rien n’a été visité au passage.

Questions fréquentes

Pourquoi certaines adresses sans « http » ne sont-elles pas trouvées ?

Parce qu’une suite de mots séparés par des points ressemble à un domaine sans en être un. « releve.py », « rapport.final.pdf », « version 1.2.3 » passeraient tous pour des adresses. Exiger un schéma explicite ou un « www. » est ce qui garantit une liste utilisable telle quelle : mieux vaut rater un « exemple.fr » isolé que rendre trente faux positifs à trier à la main.

Comment la ponctuation collée à la fin est-elle traitée ?

Elle est retirée : point, virgule, point-virgule, deux-points, guillemet fermant, point d’exclamation. Les parenthèses et les crochets sont comptés avant d’être jetés — une URL qui contient elle-même une parenthèse ouvrante garde donc sa fermante, ce qui est le cas de beaucoup d’adresses Wikipédia. C’est le détail qui sépare une liste utilisable d’une liste à corriger ligne par ligne.

Le tableau CSV s’ouvre-t-il dans Excel ?

Oui. Les colonnes sont séparées par des points-virgules, ce qu’attend Excel dans un environnement français, et les valeurs qui contiennent un point-virgule ou un guillemet sont protégées. Trois colonnes : l’adresse, le nombre de fois où elle apparaît, et le domaine — de quoi trier ou filtrer immédiatement.

Les liens sont-ils vérifiés ou ouverts ?

Aucun. Extraire un lien et le visiter sont deux choses très différentes : la seconde enverrait votre document, ou au moins la trace de sa lecture, à des serveurs tiers. Rien ne sort de votre navigateur ici, et l’outil fonctionne intégralement hors connexion — c’est la meilleure preuve qu’il n’appelle personne.

Bon à savoir

  • Une URL doit commencer par « http:// », « https:// » ou « www. » pour être reconnue. Un « exemple.fr » écrit au milieu d’une phrase n’est pas attrapé : le prendre reviendrait à ramasser aussi « releve.py », « rapport.final.pdf » et le numéro de version « 1.2.3 ».
  • La ponctuation de fin de phrase est rognée. « Voir https://exemple.fr/guide. » rend le lien sans son point final ; une parenthèse fermante n’est retirée que si elle n’a pas été ouverte dans l’URL, ce qui préserve les liens Wikipédia qui se terminent légitimement par « ) ».
  • Les liens Markdown et les liens entre chevrons sont lus correctement, mais c’est l’adresse qui est extraite, jamais le libellé cliquable qui l’accompagne.
  • Le dédoublonnage ne distingue pas les majuscules des minuscules. Deux liens qui ne diffèrent que par un « / » final, en revanche, restent deux liens différents : pour un serveur, ce ne sont pas toujours la même page.
  • Aucun lien n’est visité, ni vérifié, ni raccourci. Cette page ne fait pas une seule requête réseau — vous pouvez le constater dans l’onglet Réseau de votre navigateur, y compris hors connexion.
  • Sur un fichier HTML, les adresses sont lues dans le texte source, attributs compris. C’est efficace, mais ce n’est pas une analyse de page : un lien construit par du JavaScript n’existe nulle part dans le fichier et ne peut donc pas être trouvé.

Outils liés