Dédoublonner les lignes d’un fichier texte
Une seule fois chaque ligne, dans l’ordre où elles arrivaient.
Traité sur cet appareil · aucun envoi de fichier
TXTMDMARKDOWNCSVLOGLSTVous pouvez aussi coller du texte ou un fichier (Ctrl+V)Confortable jusqu’à 30 Mo par fichier
Aucun téléchargement : tout se passe dans cette page.détails
Cet outil n’utilise aucun moteur à télécharger — son code est déjà dans la page.
À quoi sert cette page
Une liste de diffusion recollée depuis trois sources, un inventaire tenu à la main, un journal recopié : les mêmes lignes finissent toujours par revenir deux ou trois fois. La commande « sort -u » les supprime, mais elle trie tout au passage, et l’ordre d’un inventaire porte du sens. Cette page enlève les répétitions en gardant l’ordre d’origine, dit combien de lignes ont sauté, et nomme celle qui revenait le plus souvent.
On dit aussi : dédoublonner les lignes d'un fichier texte, supprimer les lignes en double.
Comment faire
- Déposez le fichier texte dont les lignes se répètent.
- Dites si la casse et les espaces de bord doivent compter.
- Lisez le nombre de doublons supprimés, puis téléchargez le fichier nettoyé.
Questions fréquentes
En quoi est-ce différent de « sort -u » ?
La commande du terminal trie le fichier, puis supprime les lignes égales voisines : le résultat est toujours dans l’ordre alphabétique. Ici l’ordre d’origine est conservé, et c’est presque toujours ce qu’on veut — un inventaire, une liste de courses ou un journal ne se lisent pas dans l’ordre alphabétique. Le tri reste disponible en option, si c’est vraiment le résultat visé.
Pourquoi deux lignes qui semblent identiques ne sont-elles pas des doublons ?
Presque toujours à cause d’une espace invisible en fin de ligne, ou d’un caractère qui se ressemble sans être le même : l’apostrophe droite et l’apostrophe courbe, le tiret court et le tiret long, un « é » composé en deux caractères. L’option « ignorer les espaces » règle le premier cas ; pour les autres, « nettoyer un texte collé depuis un PDF » uniformise les signes typographiques avant le dédoublonnage.
Que devient une ligne gardée quand la casse est ignorée ?
Elle est rendue telle qu’elle apparaissait la première fois. Si le fichier contient « Équerre » puis « équerre », c’est « Équerre » qui reste, avec sa majuscule. En choisissant de garder la dernière occurrence, c’est l’inverse : la forme la plus récente l’emporte, ce qui est le bon réglage pour un journal où la dernière ligne fait foi.
Les lignes vides comptent-elles comme des doublons ?
Elles le seraient toutes, entre elles, et un texte aéré se retrouverait compacté d’un coup. Par défaut, elles sont donc préservées telles quelles et ne participent pas à la comparaison. En les faisant participer, on ne garde qu’une seule ligne vide dans tout le fichier — utile sur une liste, rarement sur un texte suivi.
Bon à savoir
- Deux lignes sont des doublons si elles sont identiques caractère pour caractère, selon les réglages choisis. Une différence d’accent, de tiret ou de guillemet fait deux lignes différentes : c’est une comparaison de texte, pas une recherche de ressemblance.
- L’ordre d’origine est conservé par défaut, ce qui est justement ce que « sort -u » ne fait pas. Le tri alphabétique reste disponible, mais il n’est jamais imposé.
- Sur un CSV, cette page raisonne en lignes brutes : une ligne dont un champ contient un saut de ligne entre guillemets serait mal découpée. Pour un vrai fichier de données, « dédoublonner un CSV » lit les colonnes et respecte les guillemets.
- La comparaison se fait sur la ligne entière. Dédoublonner sur une seule colonne — le numéro de client, l’adresse — relève de l’outil CSV, pas de celui-ci.
- Le fichier est chargé en mémoire, jusqu’à 30 Mo : un fichier de plusieurs millions de lignes se traite, mais l’onglet y consacre le double de sa taille le temps du traitement.