Sortowanie i usuwanie duplikatów danych (sort, uniq, cut)
Przekształcaj surowy tekst w uporządkowane, oczyszczone dane. Naucz się sortować wiersze, usuwać duplikaty za pomocą uniq i wyodrębniać kolumny przy użyciu cut, a następnie łączyć te polecenia w potoki.
Sortowanie i usuwanie duplikatów danych (sort, uniq, cut) to bezpłatna lekcja Linux Command Line & Bash Scripting Mastery na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Linux Command Line & Bash Scripting Mastery, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Linux Command Line & Bash Scripting Mastery zawiera 4 lekcji w sumie.
Przekształcanie danych tekstowych
Pliki dzienników i CSV to po prostu wiersze tekstu. Trzy klasyczne narzędzia do ich przetwarzania to: sort porządkuje wiersze, uniq usuwa duplikaty, a cut wyodrębnia kolumny.
Podstawowe sortowanie
sort domyślnie porządkuje wiersze alfabetycznie i wyświetla wynik.
sort names.txtSortowanie liczbowe
Zwykłe sortowanie traktuje liczby jak tekst (10 przed 2). Użyj -n, aby uzyskać prawdziwy porządek liczbowy, oraz -r, aby go odwrócić.
sort -n sizes.txt
sort -nr sizes.txt # largest firstSortowanie według pola
Użyj -k, aby sortować według określonej kolumny, oraz -t, aby ustawić separator.
sort -t: -k3 -n /etc/passwd # by UIDUsuwanie duplikatów za pomocą uniq
uniq scala sąsiadujące, zduplikowane wiersze. Działa tylko na posortowanych danych wejściowych, dlatego prawie zawsze używa się go razem z sort.
sort access.log | uniqZliczanie wystąpień
uniq -c poprzedza każdy wiersz liczbą jego wystąpień — idealne rozwiązanie do analizy częstotliwości.
sort ips.txt | uniq -cZnajdowanie najczęstszych elementów
Połącz sort, uniq -c i kolejne sortowanie, aby uszeregować elementy według częstotliwości — to raport „top N” w jednym wierszu.
sort ips.txt | uniq -c | sort -nr | head -5Wyodrębnianie kolumn za pomocą cut
cut pobiera pola z każdego wiersza. Użyj -d, aby określić separator, oraz -f, aby wskazać numery pól.
cut -d, -f1,3 data.csv # 1st and 3rd columnsWycinanie według znaków
cut -c wyodrębnia zakresy znaków według pozycji, co jest przydatne w przypadku danych o stałej szerokości.
cut -c1-8 dates.txt # first 8 charsWiersze unikatowe a zduplikowane
uniq -d pokazuje tylko powtarzające się wiersze, natomiast uniq -u pokazuje tylko wiersze występujące dokładnie raz.
sort orders.txt | uniq -d # repeated onlyTworzenie potoku
Prawdziwa moc tkwi w łączeniu poleceń: wyodrębnij kolumnę, posortuj ją, a następnie zlicz wartości unikatowe, aby podsumować zbiór danych jednym poleceniem.
cut -d, -f2 sales.csv | sort | uniq -c | sort -nrSzybki test
Sprawdź, czy rozumiesz ten temat.
Podsumowanie
Poznałeś(-aś) sposoby przetwarzania danych za pomocą sort (alfabetycznie, liczbowo -n, według pola -k), uniq (usuwanie sąsiadujących duplikatów, -c zliczanie, -d/-u) oraz cut (pola za pomocą -d/-f, znaki za pomocą -c) — łączonych w wydajne potoki.
Często zadawane pytania
Czy lekcja „Sortowanie i usuwanie duplikatów danych (sort, uniq, cut)” jest bezpłatna?
Tak — pełny tekst „Sortowanie i usuwanie duplikatów danych (sort, uniq, cut)” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Linux Command Line & Bash Scripting Mastery, przejdź na CoddyKit PRO. Kurs Linux Command Line & Bash Scripting Mastery zawiera 4 lekcji w sumie.
Co nauczysz się w „Sortowanie i usuwanie duplikatów danych (sort, uniq, cut)”?
Przekształcaj surowy tekst w uporządkowane, oczyszczone dane. Naucz się sortować wiersze, usuwać duplikaty za pomocą uniq i wyodrębniać kolumny przy użyciu cut, a następnie łączyć te polecenia w poto… Ćwiczysz Linux Command Line & Bash Scripting Mastery z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Linux Command Line & Bash Scripting Mastery?
Nie wymagamy żadnego doświadczenia. Linux Command Line & Bash Scripting Mastery w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.
Ile czasu zajmuje lekcja „Sortowanie i usuwanie duplikatów danych (sort, uniq, cut)”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Linux Command Line & Bash Scripting Mastery?
Tak. Każda lekcja Linux Command Line & Bash Scripting Mastery zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Zaawansowana manipulacja tekstem (sed, awk)
- Archiwizowanie i kompresja (tar, gzip, unzip)
- Wykorzystanie dysku i informacje o systemie (df, du, uname)
- Sortowanie i usuwanie duplikatów danych (sort, uniq, cut)