산포: 분산과 표준편차
데이터가 실제로 얼마나 퍼져 있는지 알아봅니다
산포: 분산과 표준편차은(는) CoddyKit의 무료 Data Science Academy 강의입니다. 이것은 4개 중 2번째 강의입니다. 아래에서 전체 강의를 무료로 읽을 수 있으며, 내장 코드 에디터와 24/7 AI 튜터와 함께 브라우저에서 직접 실습할 수 있습니다. 이 강의는 Data Science Academy 학습 경로의 일부이며, 진행 상황이 웹과 CoddyKit 앱에 동기화됩니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
중심만으로는 충분하지 않습니다
두 열의 평균이 같아도 모양은 완전히 다를 수 있습니다. 차이를 알아내려면 값이 얼마나 넓게 흩어져 있는지 나타내는 퍼짐을 측정해야 합니다. 📏
평균으로부터의 편차
퍼짐은 각 점이 평균에서 얼마나 떨어져 있는지, 즉 편차에서 시작합니다. 편차가 작으면 데이터가 조밀하고, 크면 데이터가 넓게 퍼져 있습니다.
편차를 제곱하는 이유
양의 편차와 음의 편차를 더하면 서로 상쇄되어 0이 됩니다. 그래서 먼저 각 편차를 제곱해 모든 차이를 양의 기여값으로 바꿉니다.
분산의 정의
분산은 제곱한 편차들의 평균입니다. 분산이 클수록 값이 평균에서 더 멀리 벗어납니다.
df["price"].var()단위의 문제
제곱하면 단위도 함께 커집니다. 달러로 표시된 가격의 분산은 달러의 제곱 단위가 되어 한눈에 해석하기 어렵습니다.
표준편차의 해결책
분산의 제곱근을 구하면 표준편차를 얻습니다. 데이터와 같은 단위를 사용하므로 결과를 훨씬 쉽게 이해할 수 있습니다.
df["price"].std()표준편차 읽기
표준편차는 각 점이 평균에서 떨어진 일반적인 거리라고 볼 수 있습니다. std가 작으면 값이 일정하고, 크면 변동성이 큽니다.
68퍼센트 규칙
종 모양에 가까운 데이터에서는 값의 약 68퍼센트가 평균에서 한 표준편차 이내에 있습니다. 데이터 범위를 빠르게 점검할 수 있는 방법입니다.
표본과 모집단
pandas는 기본적으로 n-1로 나누는 표본 버전을 사용합니다. 데이터가 더 큰 집단에서 추출한 표본일 때 이 작은 조정으로 편향을 보정할 수 있습니다.
퍼짐으로 비교하기
표준편차를 사용하면 일관성을 공정하게 비교할 수 있습니다. 배송 시간의 std가 더 작은 상품이 더 신뢰할 만한 상품입니다.
한눈에 두 값 확인하기
두 값을 직접 비교해 선택할 필요가 없습니다. describe의 출력에는 모든 숫자 열에 대한 std가 이미 포함되어 있습니다.
df.describe().loc["std"]빠른 확인
원본 데이터와 같은 단위를 사용하는 퍼짐 측정값이 필요합니다.
복습: 퍼짐 측정하기
분산은 거리의 제곱을 평균 내고, 표준편차는 그 결과를 실제 단위로 되돌린다는 것을 배웠습니다. 두 값을 함께 사용하면 데이터가 얼마나 변하는지 알 수 있습니다. 🌟
자주 묻는 질문
“산포: 분산과 표준편차” 강의는 무료인가요?
네 — “산포: 분산과 표준편차” 전체 내용을 이 웹사이트에서 무료로 읽을 수 있습니다. 인터랙티브하게 실습하려면(내장 코드 에디터와 24/7 AI 튜터), CoddyKit PRO로 업그레이드하면 Data Science Academy 강의 전체를 잠금 해제할 수 있습니다. Data Science Academy 강의에는 총 4개의 강의가 포함되어 있습니다.
“산포: 분산과 표준편차”에서 뭘 배우나요?
데이터가 실제로 얼마나 퍼져 있는지 알아봅니다 브라우저에서 직접 실행하는 실습 코드로 Data Science Academy을(를) 배우며, 24/7 AI 튜터가 강의를 진행하면서 질문에 답변해줍니다.
Data Science Academy을(를) 시작하는 데 경험이 필요한가요?
사전 경험은 필요하지 않습니다. CoddyKit의 Data Science Academy은(는) 초급자부터 고급 학습자까지를 위해 구성되어 있으므로, 여기서 시작하거나 처음부터 시작할 수 있으며 자신의 속도대로 진행할 수 있습니다. 이것은 4개 중 2번째 강의입니다.
“산포: 분산과 표준편차” 강의는 얼마나 걸리나요?
대부분의 CoddyKit 강의는 약 5~10분이 소요됩니다. 각 강의는 간결하고 인터랙티브하여 꾸준한 진행이 가능하며, 웹과 앱에서 중단한 부분부터 바로 시작할 수 있습니다.
이 Data Science Academy 강의에서 코드를 작성하고 실행할 수 있나요?
네. 모든 Data Science Academy 강의에는 내장 코드 에디터가 포함되어 있으므로, 브라우저에서 바로 실제 코드를 작성하고 실행한 후 즉시 AI 피드백을 받을 수 있습니다 — 로컬 설정이 필요 없습니다.
이 강의의 모든 강의
- 평균, 중앙값, 최빈값
- 산포: 분산과 표준편차
- 최솟값, 최댓값, 사분위수
- 이상치와 그 의미