k-Means와 k 선택하기
엘보 방법과 실루엣 방법을 알아봅니다
k-Means와 k 선택하기은(는) CoddyKit의 무료 Data Science Academy 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Data Science Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
대표적인 군집화 알고리즘
k-Means는 가장 인기 있는 군집화 알고리즘입니다. 중심 anchor 주변으로 점을 묶어 data를 k개의 group으로 나눕니다. 🎯
중심점은 anchor입니다
각 cluster에는 구성원들의 평균 위치인 중심점이 있습니다. 점은 자신과 가장 가까운 중심점의 cluster에 속합니다.
반복되는 과정
k-Means는 두 단계를 번갈아 실행합니다. 모든 점을 가장 가까운 중심점에 할당한 다음, 새 구성원으로 각 중심점을 다시 계산합니다.
안정 상태에 도달합니다
할당이 더 이상 바뀌지 않을 때까지 이 단계를 반복합니다. 알고리즘이 수렴하고 cluster가 최종 결정됩니다.
먼저 k를 선택합니다
k-Means는 group 수를 스스로 만들어 낼 수 없습니다. 먼저 k를 선택해야 하며, 적절한 값이 분명한 경우는 드뭅니다.
한 줄로 실행하기
scikit-learn에서는 적합이 간단합니다. 선택한 k를 n_clusters에 설정하고 크기를 조정한 data에 fit을 호출하세요.
from sklearn.cluster import KMeans
model = KMeans(n_clusters=3).fit(X)응집도를 측정하는 관성
적합한 후 관성은 점과 해당 중심점 사이 거리의 제곱을 모두 더한 값을 보여 줍니다. 값이 낮을수록 cluster가 더 조밀합니다.
model.inertia_팔꿈치 방법
여러 k 값에 대해 관성(inertia)을 그려 보십시오. 곡선이 급격히 꺾이는 지점인 엘보가 적절한 클러스터 수를 나타내는 경우가 많습니다.
수익 체감
엘보를 지나면 클러스터를 추가해도 관성이 거의 줄어들지 않습니다. 이렇게 평평해지는 현상은 이미 잘 맞는 그룹을 그저 분할하고 있다는 신호입니다.
실루엣 점수
두 번째 기준은 실루엣 점수입니다. 이 점수는 각 점이 자신의 클러스터에 가깝고 다른 클러스터에서는 멀리 떨어져 있을수록 높게 평가합니다.
from sklearn.metrics import silhouette_score더 현명하게 시작하기
무작위 시작점은 좋지 않은 결과로 이어질 수 있으므로 scikit-learn은 기본적으로 k-means++를 사용합니다. k-means++는 초기 중심점을 서로 떨어뜨려 더 안정적인 결과를 냅니다.
빠른 확인
적절한 k를 어떻게 선택할지 확인해 보겠습니다.
정리
k-평균은 선택한 k에 따라 중심점을 기준으로 점을 그룹화합니다. 엘보와 실루엣을 활용하면 k를 적절하게 선택할 수 있습니다. 🎯
AI 튜터와 함께 Python을(를) 배우세요 — 무료
브라우저에서 실제 코드를 작성하고 실행하며, 24/7 AI 튜터로부터 즉각적인 도움을 받고, 웹이나 앱에서 중단한 부분부터 계속 학습하세요.
- 코스
- 30
- 레슨
- 120
자주 묻는 질문
“k-Means와 k 선택하기” 강의는 무료인가요?
네 — “k-Means와 k 선택하기” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Data Science Academy 강의 전체를 잠금 해제할 수 있습니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“k-Means와 k 선택하기”에서 뭘 배우나요?
엘보 방법과 실루엣 방법을 알아봅니다 브라우저에서 직접 실행하는 실습 코드로 Data Science Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Data Science Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Data Science Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.
“k-Means와 k 선택하기” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Data Science Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Data Science Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 지도 학습과 비지도 학습
- k-Means와 k 선택하기
- 계층적 군집화와 DBSCAN
- 군집 프로파일링과 이름 붙이기