Supprimer les lignes en double
Nettoyez une liste : retirez les doublons, triez-la correctement, supprimez les lignes vides. L'outil vous indique quelles lignes étaient en double et combien de fois, au lieu de raccourcir votre liste en silence.
- Jamais conservé
- Pas de file d'attente, pas d'attente
- Sans inscription, sans filigrane
Le résultat (Résultat) s'affiche ici.
Comment ça marche
Collez votre liste
E-mails, URL, codes produit, n'importe quoi, une entrée par ligne. Ou déposez un fichier texte.
Choisissez ce que « identique » veut dire
Ignorer les espaces de fin, ignorer les majuscules, garder la première ou la dernière occurrence — ou supprimer toutes les lignes qui avaient un doublon.
Triez et nettoyez
Triez dans l'ordre naturel, inversez, mélangez, numérotez les lignes ou supprimez les lignes vides — puis copiez le résultat.
Ce qui arrive aux lignes que vous gardez
Deux traitements différents des espaces coexistent sur cette page, et mieux vaut ne pas les confondre. La suppression des espaces pour la comparaison sert à construire la clé et ne modifie jamais vos lignes — l'exemplaire conservé garde exactement son espacement d'origine. Les options de nettoyage font l'inverse : supprimer l'indentation, réduire les suites d'espaces et de tabulations, retirer les espaces aux extrémités des lignes sont de vraies modifications, appliquées avant tout dédoublonnage — en activer une change donc discrètement ce qui compte comme doublon, en plus de l'apparence des lignes.
Une ligne vide est comparée comme n'importe quelle autre ligne : toutes les lignes vides après la première disparaissent avec les autres doublons — une liste aérée de sauts de paragraphe revient avec une seule ligne vide, à l'emplacement de la première. Et le rapport des répétitions affiche la clé plutôt que votre ligne : sans espaces aux extrémités, et en minuscules si vous avez demandé d'ignorer les majuscules. Une entrée présente dans votre liste à la fois sous la forme Smith et SMITH est donc signalée une seule fois, en minuscules, avec un compte de deux. Cette liste se limite aux cinquante entrées les plus fréquentes.
Quoi qu'il entre, ce qui sort est joint uniquement par des sauts de ligne : une liste collée depuis un fichier Windows perd donc ses retours chariot au passage — c'est généralement ce que vous vouliez, et bon à savoir si vous recollez le résultat dans un logiciel qui y est sensible. Un dernier effet de bord : activer « Ignorer les majuscules » modifie le tri en plus de la comparaison, et le tri cesse alors aussi de distinguer les lettres accentuées des lettres simples, si bien que resume et résumé ressortent ensemble plutôt que séparés.
Si vous cherchez autre chose
Quand la liste est en réalité un tableau, la comparaison de lignes n'est pas le bon outil. Un CSV où « doublon » signifie deux lignes identiques sur une colonne n'est pas une question de chaînes de caractères, et le traiter comme tel fait soit rater les doublons, soit supprimer des lignes qui se ressemblaient seulement. La fonction Supprimer les doublons d'un tableur fait cela correctement pour un fichier que vous avez déjà ouvert, et mlr uniq -g le fait en ligne de commande en désignant le champ qui tranche, quelle que soit la taille.
Pour une liste trop grande pour tenir dans un onglet, ou que vous nettoierez encore la semaine prochaine, la ligne de commande tient en une seule expression qui lit en flux : awk '!seen[$0]++' garde le premier exemplaire et l'ordre d'origine, exactement ce que fait cette page par défaut, sur un fichier plus gros que votre mémoire. Sans suppression des espaces, sans insensibilité à la casse et sans rapport des répétitions — c'est le compromis, et pour un fichier de dix millions de lignes c'est le bon.
Questions fréquentes
Ma liste est-elle conservée quelque part ?
Non. Rien n'est conservé et aucune requête n'est envoyée. Vous pouvez vous déconnecter d'Internet une fois la page chargée, elle continue de fonctionner.
Pourquoi reste-t-il des doublons après les avoir supprimés ?
Presque toujours à cause d'espaces en fin de ligne. Deux lignes qui se terminent par un nombre d'espaces différent paraissent identiques à l'écran mais ne le sont pas : une comparaison exacte garde donc les deux — et vous en concluez que l'outil ne marche pas. C'est pourquoi la suppression des espaces avant comparaison est ACTIVÉE par défaut ici. Point important : elle n'affecte que la COMPARAISON — la ligne conservée garde son texte d'origine, car modifier vos lignes en douce n'est pas ce que veut dire « supprimer les doublons ».
Quel exemplaire est conservé ?
Le premier, par défaut, et l'ordre des autres n'est pas modifié — ce qui compte quand une liste est déjà dans un ordre qui a du sens. Vous pouvez garder le dernier à la place, ou supprimer toutes les lignes qui avaient un doublon, pour ne garder que celles apparues exactement une fois. Cette dernière option permet de trouver les entrées propres à une liste.
Pourquoi le tri place-t-il item10 avant item2 ?
C'est le tri alphabétique ordinaire, où « 1 » vient avant « 2 » et où le reste du nombre n'est jamais examiné. Activez le tri naturel et les suites de chiffres sont comparées comme des nombres : item2 vient alors avant item10 — l'ordre qu'une personne attend. Les textes accentués sont aussi bien gérés : une comparaison simple classe « Zürich » après « Zyzzyva », parce qu'elle compare les valeurs numériques sous-jacentes plutôt que les lettres.
Indique-t-il ce qui a été supprimé ?
Oui — les lignes apparues plus d'une fois sont listées avec leur nombre d'occurrences, des plus fréquentes aux moins fréquentes. Savoir QUELLE entrée est apparue quatre fois est généralement plus utile que de savoir que trois lignes ont disparu.
Le mélange est-il vraiment aléatoire ?
Oui. Il utilise un mélange de Fisher-Yates avec la source d'aléa cryptographique du navigateur. Le raccourci courant — trier avec une comparaison aléatoire — n'est pas du tout un mélange : les algorithmes de tri supposent une comparaison cohérente, et avec une comparaison aléatoire le résultat est sensiblement biaisé vers l'ordre d'origine. Si vous tirez un gagnant au sort dans une liste, cette différence compte.
Y a-t-il une limite de taille ?
La mémoire disponible, plutôt qu'une taille maximale fixe. Des listes de plusieurs centaines de milliers de lignes ne posent aucun problème.
Bon à savoir : Le tri suit les règles linguistiques de votre navigateur : les lettres accentuées et les différents alphabets sont classés comme un lecteur s'y attend, et non selon la valeur des octets. Cela signifie aussi que l'ordre peut légèrement varier d'un navigateur à l'autre. Les très grandes listes sont chargées entièrement en mémoire.
Intégrez cet outil à votre site
Gratuit pour tout blog, page de cours ou article d'aide. Collez un seul extrait de code et vos visiteurs pourront l'utiliser directement sur votre page.
Voir aussi : Utilitaires texte
Compteur de mots
Mots, phrases et temps de lecture
Convertisseur de casse
MAJUSCULES, minuscules, Titre, camelCase et les autres
Comparer des textes
Voyez exactement ce qui a changé entre deux versions
Compteur de caractères
Caractères, octets et ce que votre limite compte vraiment
Minifier HTML
Allégez le HTML sans casser la page
Minifier CSS
Allégez une feuille de style, ou sachez pourquoi c'est impossible