데이터 정렬 및 중복 제거 (sort, uniq, cut)
원시 텍스트를 깔끔하고 정렬된 데이터로 바꾸는 방법을 배웁니다. 줄을 정렬하고, uniq로 중복을 제거하고, cut으로 열을 추출한 다음 이를 파이프라인으로 연결하는 방법을 익힙니다.
데이터 정렬 및 중복 제거 (sort, uniq, cut)은(는) CoddyKit의 무료 DevOps Bootcamp 강의입니다. 이것은 4개 중 4번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 DevOps Bootcamp 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. DevOps Bootcamp 강의에는 총 4개의 강의가 포함되어 있습니다.
텍스트 데이터 다루기
로그 파일과 CSV는 그저 텍스트 줄일 뿐입니다. 세 가지 대표 도구로 이를 다룰 수 있습니다. sort는 줄의 순서를 정하고, uniq는 중복을 제거하며, cut은 열을 추출합니다.
기본 정렬
sort는 기본적으로 줄을 알파벳순으로 정렬하여 결과를 출력합니다.
sort names.txt숫자 정렬
일반 정렬은 숫자를 텍스트로 취급하므로 10이 2보다 먼저 옵니다. 실제 숫자 순서를 사용하려면 -n을 사용하고, 순서를 뒤집으려면 -r을 사용합니다.
sort -n sizes.txt
sort -nr sizes.txt # largest first필드 기준으로 정렬하기
-k를 사용하면 특정 열을 기준으로 정렬하고, -t를 사용하면 구분자를 지정할 수 있습니다.
sort -t: -k3 -n /etc/passwd # by UIDuniq로 중복 제거하기
uniq는 연속된 중복 줄을 하나로 합칩니다. 정렬된 입력에서만 제대로 작동하므로 거의 항상 sort와 함께 사용합니다.
sort access.log | uniq출현 횟수 세기
uniq -c는 각 줄 앞에 해당 줄이 나타난 횟수를 붙입니다. 빈도 분석에 매우 적합합니다.
sort ips.txt | uniq -c상위 항목 찾기
sort, uniq -c, 그리고 또 다른 sort를 조합하면 빈도순으로 항목의 순위를 매길 수 있습니다. 한 줄로 작성하는 "상위 N개" 보고서입니다.
sort ips.txt | uniq -c | sort -nr | head -5cut으로 열 추출하기
cut은 각 줄에서 필드를 가져옵니다. 구분자에는 -d를 사용하고 필드 번호에는 -f를 사용합니다.
cut -d, -f1,3 data.csv # 1st and 3rd columns문자 기준으로 자르기
cut -c는 위치를 기준으로 문자 범위를 추출하며, 고정 너비 데이터에 유용합니다.
cut -c1-8 dates.txt # first 8 chars고유한 줄과 중복 줄
uniq -d는 반복되는 줄만 표시하고, uniq -u는 정확히 한 번만 나타나는 줄만 표시합니다.
sort orders.txt | uniq -d # repeated only파이프라인 만들기
진정한 강점은 명령을 연결하는 데 있습니다. 한 열을 추출하고 정렬한 다음 고유한 항목의 개수를 세면 한 명령으로 데이터 세트를 요약할 수 있습니다.
cut -d, -f2 sales.csv | sort | uniq -c | sort -nr빠른 확인
이해한 내용을 테스트해 보십시오.
복습
sort(알파벳순, 숫자순 -n, 필드 기준 -k), uniq(연속된 줄 중복 제거, -c 개수 세기, -d/-u), cut(-d/-f로 필드, -c로 문자)를 사용해 데이터를 다루는 방법을 배웠습니다. 이러한 명령을 연결하면 강력한 파이프라인을 만들 수 있습니다.
자주 묻는 질문
“데이터 정렬 및 중복 제거 (sort, uniq, cut)” 강의는 무료인가요?
네 — “데이터 정렬 및 중복 제거 (sort, uniq, cut)” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 DevOps Bootcamp 강의 전체를 잠금 해제할 수 있습니다. DevOps Bootcamp 강의에는 총 4개의 강의가 포함되어 있습니다.
“데이터 정렬 및 중복 제거 (sort, uniq, cut)”에서 뭘 배우나요?
원시 텍스트를 깔끔하고 정렬된 데이터로 바꾸는 방법을 배웁니다. 줄을 정렬하고, uniq로 중복을 제거하고, cut으로 열을 추출한 다음 이를 파이프라인으로 연결하는 방법을 익힙니다. 브라우저에서 직접 실행하는 실습 코드로 DevOps Bootcamp을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
DevOps Bootcamp을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 DevOps Bootcamp은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 4번째 강의입니다.
“데이터 정렬 및 중복 제거 (sort, uniq, cut)” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 DevOps Bootcamp 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 DevOps Bootcamp 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 고급 텍스트 조작(sed, awk)
- 보관 및 압축(tar, gzip, unzip)
- 디스크 사용량 및 시스템 정보(df, du, uname)
- 데이터 정렬 및 중복 제거 (sort, uniq, cut)