Trier et dédupliquer les données (sort, uniq, cut)
Transformez du texte brut en données propres et ordonnées. Apprenez à trier les lignes, à supprimer les doublons avec uniq et à extraire des colonnes avec cut, puis à les enchaîner dans des chaînes de traitement.
Trier et dédupliquer les données (sort, uniq, cut) est une leçon DevOps Bootcamp gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage DevOps Bootcamp, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours DevOps Bootcamp comprend 4 leçons au total.
Mettre en forme des données textuelles
Les fichiers journaux et les fichiers CSV ne sont que des lignes de texte. Trois outils classiques permettent de les traiter : sort ordonne les lignes, uniq supprime les doublons et cut extrait les colonnes.
Tri de base
sort classe les lignes par ordre alphabétique par défaut et affiche le résultat.
sort names.txtTri numérique
Le tri simple traite les nombres comme du texte (10 avant 2). Utilisez -n pour un véritable ordre numérique et -r pour inverser l’ordre.
sort -n sizes.txt
sort -nr sizes.txt # largest firstTrier selon un champ
Utilisez -k pour trier selon une colonne précise et -t pour définir le séparateur.
sort -t: -k3 -n /etc/passwd # by UIDSupprimer les doublons avec uniq
uniq regroupe les lignes en double adjacentes. Il ne fonctionne que sur des données d’entrée triées ; il est donc presque toujours associé à sort.
sort access.log | uniqCompter les occurrences
uniq -c préfixe chaque ligne par le nombre de fois où elle est apparue — idéal pour analyser les fréquences.
sort ips.txt | uniq -cTrouver les éléments les plus fréquents
Combinez sort, uniq -c et un autre sort pour classer les éléments par fréquence — un rapport « top N » en une seule ligne.
sort ips.txt | uniq -c | sort -nr | head -5Extraire des colonnes avec cut
cut extrait les champs de chaque ligne. Utilisez -d pour le séparateur et -f pour les numéros de champ.
cut -d, -f1,3 data.csv # 1st and 3rd columnsExtraire selon les caractères
cut -c extrait des plages de caractères selon leur position, ce qui est utile pour les données à largeur fixe.
cut -c1-8 dates.txt # first 8 charsLignes uniques et lignes en double
uniq -d affiche uniquement les lignes répétées, tandis que uniq -u affiche uniquement celles qui apparaissent exactement une fois.
sort orders.txt | uniq -d # repeated onlyConstruire un pipeline
La véritable puissance vient de l’enchaînement : extraire une colonne, la trier, puis compter les valeurs uniques pour résumer un jeu de données avec une seule commande.
cut -d, -f2 sales.csv | sort | uniq -c | sort -nrVérification rapide
Vérifiez votre compréhension.
Récapitulatif
Vous avez appris à traiter les données avec sort (alphabétique, numérique avec -n, par champ avec -k), uniq (déduplication des lignes adjacentes, comptage avec -c, -d/-u) et cut (champs avec -d/-f, caractères avec -c) — puis à les enchaîner dans de puissants pipelines.
Questions Fréquemment Posées
La leçon « Trier et dédupliquer les données (sort, uniq, cut) » est-elle gratuite ?
Oui — le texte complet de « Trier et dédupliquer les données (sort, uniq, cut) » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours DevOps Bootcamp, passe à CoddyKit PRO. Le cours DevOps Bootcamp comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Trier et dédupliquer les données (sort, uniq, cut) » ?
Transformez du texte brut en données propres et ordonnées. Apprenez à trier les lignes, à supprimer les doublons avec uniq et à extraire des colonnes avec cut, puis à les enchaîner dans des chaînes d… Tu pratiques DevOps Bootcamp avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer DevOps Bootcamp ?
Aucune expérience préalable n'est requise. DevOps Bootcamp sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.
Combien de temps prend la leçon « Trier et dédupliquer les données (sort, uniq, cut) » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon DevOps Bootcamp ?
Oui. Chaque leçon DevOps Bootcamp inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Manipulation avancée de texte (sed, awk)
- Archivage et compression (tar, gzip, unzip)
- Utilisation du disque et informations système (df, du, uname)
- Trier et dédupliquer les données (sort, uniq, cut)