Extraire les liens d’un texte
Toutes les URL d’un document, dédoublonnées, en liste ou en tableau.
Traité sur cet appareil · aucun envoi de fichier
TXTMDMARKDOWNCSVLOGHTML+3Vous pouvez aussi coller du texte ou un fichier (Ctrl+V)Confortable jusqu’à 30 Mo par fichier
Aucun téléchargement : tout se passe dans cette page.détails
Cet outil n’utilise aucun moteur à télécharger — son code est déjà dans la page.
À quoi sert cette page
Une note de réunion pleine d’adresses, un export de messagerie, un article enregistré en texte : les liens y sont, éparpillés, collés à la ponctuation, parfois répétés dix fois. Les récupérer un par un à la souris est fastidieux et on en oublie toujours. Cette page les rassemble tous, retire la ponctuation qui n’appartient pas à l’adresse, les dédoublonne, et vous rend une liste propre ou un tableau avec le domaine et le nombre d’occurrences.
On dit aussi : extraire les liens d'un texte, récupérer toutes les urls.
Comment faire
- Déposez le fichier texte, Markdown ou HTML qui contient les liens.
- Choisissez l’ordre, et si vous voulez la liste des adresses ou celle des domaines.
- Téléchargez la liste ou le CSV — rien n’a été visité au passage.
Questions fréquentes
Pourquoi certaines adresses sans « http » ne sont-elles pas trouvées ?
Parce qu’une suite de mots séparés par des points ressemble à un domaine sans en être un. « releve.py », « rapport.final.pdf », « version 1.2.3 » passeraient tous pour des adresses. Exiger un schéma explicite ou un « www. » est ce qui garantit une liste utilisable telle quelle : mieux vaut rater un « exemple.fr » isolé que rendre trente faux positifs à trier à la main.
Comment la ponctuation collée à la fin est-elle traitée ?
Elle est retirée : point, virgule, point-virgule, deux-points, guillemet fermant, point d’exclamation. Les parenthèses et les crochets sont comptés avant d’être jetés — une URL qui contient elle-même une parenthèse ouvrante garde donc sa fermante, ce qui est le cas de beaucoup d’adresses Wikipédia. C’est le détail qui sépare une liste utilisable d’une liste à corriger ligne par ligne.
Le tableau CSV s’ouvre-t-il dans Excel ?
Oui. Les colonnes sont séparées par des points-virgules, ce qu’attend Excel dans un environnement français, et les valeurs qui contiennent un point-virgule ou un guillemet sont protégées. Trois colonnes : l’adresse, le nombre de fois où elle apparaît, et le domaine — de quoi trier ou filtrer immédiatement.
Les liens sont-ils vérifiés ou ouverts ?
Aucun. Extraire un lien et le visiter sont deux choses très différentes : la seconde enverrait votre document, ou au moins la trace de sa lecture, à des serveurs tiers. Rien ne sort de votre navigateur ici, et l’outil fonctionne intégralement hors connexion — c’est la meilleure preuve qu’il n’appelle personne.
Bon à savoir
- Une URL doit commencer par « http:// », « https:// » ou « www. » pour être reconnue. Un « exemple.fr » écrit au milieu d’une phrase n’est pas attrapé : le prendre reviendrait à ramasser aussi « releve.py », « rapport.final.pdf » et le numéro de version « 1.2.3 ».
- La ponctuation de fin de phrase est rognée. « Voir https://exemple.fr/guide. » rend le lien sans son point final ; une parenthèse fermante n’est retirée que si elle n’a pas été ouverte dans l’URL, ce qui préserve les liens Wikipédia qui se terminent légitimement par « ) ».
- Les liens Markdown et les liens entre chevrons sont lus correctement, mais c’est l’adresse qui est extraite, jamais le libellé cliquable qui l’accompagne.
- Le dédoublonnage ne distingue pas les majuscules des minuscules. Deux liens qui ne diffèrent que par un « / » final, en revanche, restent deux liens différents : pour un serveur, ce ne sont pas toujours la même page.
- Aucun lien n’est visité, ni vérifié, ni raccourci. Cette page ne fait pas une seule requête réseau — vous pouvez le constater dans l’onglet Réseau de votre navigateur, y compris hors connexion.
- Sur un fichier HTML, les adresses sont lues dans le texte source, attributs compris. C’est efficace, mais ce n’est pas une analyse de page : un lien construit par du JavaScript n’existe nulle part dans le fichier et ne peut donc pas être trouvé.