본문으로 바로가기

통계 계산 완전 가이드: 평균·중앙값·표준편차·사분위수 한 번에

2026.03.312026.07.10 수정23분 읽기

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

목차

"평균 연봉 5,000만원", "중간 집값 7억원", "변동성 표준편차 15%"…
뉴스에서 매일 마주치는 통계 수치는 데이터를 한 줄로 요약하는 도구입니다. 그러나 평균이 항상 대표값으로 적절한 것은 아니며,
어떤 지표를 선택하느냐에 따라 데이터의 의미가 완전히 달라질 수 있습니다.

이 글은 기술 통계의 핵심 지표(평균·중앙값·최빈값·분산·표준편차·사분위수)의 정확한 계산법, 각 지표가 적합한 상황,
그리고 한국 통계청·뉴스 데이터를 올바르게 읽는 방법까지 정리합니다.

통계가 필요한 이유#

통계는 데이터를 요약하고 의미를 파악하는 도구입니다. 시험 점수 50개, 직원 연봉 1,000개, 상품 판매량 데이터를 그대로 보면
어디서부터 봐야 할지 막막합니다. 평균·중앙값 같은 대표값(representative value),
표준편차 같은 산포도(dispersion measure)로 데이터를 요약하면
빠르게 핵심을 파악할 수 있습니다.

기술 통계(descriptive statistics)는 데이터의 특성을 묘사하는 도구이고,
이를 바탕으로 가설 검정·예측을 수행하는 것이 추론 통계(inferential statistics)입니다. 본 가이드는 기술 통계 부분을 다룹니다.

중심 경향치: 데이터의 "중심" 파악#

평균(Mean, 산술 평균)#

모든 값을 더한 후 개수로 나눈 값입니다.

공식: 평균 = 합계 ÷ 개수

예시: [2, 4, 6, 8, 10]의 평균

(2 + 4 + 6 + 8 + 10) ÷ 5 = 30 ÷ 5 = 6

주의: 이상값(극단값)에 매우 민감합니다.

5명의 연봉이 [3,000만, 3,000만, 3,000만, 3,000만, 10억]이라면
평균 = (3,000만 × 4 + 10억) ÷ 5 = 약 2억 4천만원
하지만 4명의 실제 연봉은 3,000만원입니다!

중앙값(Median)#

데이터를 크기 순으로 정렬했을 때 중간에 위치한 값입니다.

  • 홀수 개: 정확히 가운데 값
  • 짝수 개: 가운데 두 값의 평균

예시 1(홀수 개): [1, 3, 5, 7, 9] → 중앙값 = 5
예시 2(짝수 개): [2, 4, 6, 8] → 중앙값 = (4+6)/2 = 5

이상값에 강건: 위의 연봉 예시에서

중앙값 = 3,000만원 (실제 상황을 더 잘 반영)

부동산 가격, 가구 소득, 임금 통계처럼 한쪽으로 치우친 분포(skewed distribution)에서는
중앙값이 평균보다 훨씬 정확한 대표값입니다. 통계청도 평균소득과 중위소득을 함께 공표하는 이유입니다.

최빈값(Mode)#

가장 자주 등장하는 값입니다.

예시: [1, 2, 2, 3, 3, 3, 4] → 최빈값 = 3

활용: 선거 분석, 가장 인기 있는 상품 사이즈, 고객 불만 유형 중 가장 흔한 패턴 찾기 등 범주형 데이터(categorical data)에서
특히 유용합니다.

데이터에 동일 빈도의 값이 여러 개라면 다중 최빈값(multimodal)으로 부르고,
모든 값이 한 번씩만 등장하면 최빈값이 없거나 모든 값이 최빈값이라고 표현합니다.

평균 vs 중앙값 vs 최빈값: 언제 어떤 지표?#

같은 데이터라도 어떤 지표를 선택하느냐에 따라 결과 해석이 완전히 달라집니다.

5명의 월급 사례#

[200, 220, 230, 250, 1500] (단위: 만원)
지표해석
평균480만원1인의 고연봉에 크게 왜곡됨
중앙값230만원실제 '중간'을 잘 표현
최빈값없음각 값이 1번씩만 등장

"우리 팀 평균 월급 480만원"은 사실이지만 오해를 부릅니다. 중앙값 230만원이 더 정직한 표현입니다.

적합한 상황 매트릭스#

상황권장 지표이유
시험 점수 분석평균정규분포 가까움
가구 소득·자산중앙값고소득자가 평균 왜곡
부동산 시세중앙값강남 고가 아파트가 평균 왜곡
병원 대기 시간중앙값일부 긴 대기로 평균이 길어짐
인기 신발 사이즈최빈값재고 관리
가장 자주 선택된 메뉴최빈값마케팅
일일 평균 기온평균정규분포
공장 제품 평균 무게평균품질 관리

산포도: 데이터가 얼마나 "퍼져 있는가"#

평균·중앙값만으로는 데이터를 완전히 설명하지 못합니다. 같은 평균이라도 데이터 분포가 좁게 모여 있는지, 넓게 퍼져 있는지에 따라 의미가 다릅니다.

분산(Variance)#

각 값이 평균으로부터 얼마나 떨어져 있는지를 제곱해 평균낸 값입니다.

공식(모분산):

분산 = Σ(xi − 평균)² ÷ N

예시: [2, 4, 6, 8, 10], 평균 = 6

분산 = [(2−6)² + (4−6)² + (6−6)² + (8−6)² + (10−6)²] ÷ 5
     = [16 + 4 + 0 + 4 + 16] ÷ 5
     = 40 ÷ 5 = 8

모분산(N으로 나눔)과 표본분산(N−1로 나눔, 베셀 보정) 두 가지가 있습니다. 모집단 전체 데이터일 때는 N, 표본일 때는 N−1을 사용합니다.

표준편차(Standard Deviation)#

분산의 제곱근입니다. 데이터의 평균적인 편차를 원래 단위로 나타냅니다.

공식: 표준편차 = √분산

위 예시에서 표준편차 = √8 ≈ 2.83

해석:

  • 표준편차가 작다 → 데이터가 평균 주위에 몰려 있음 (안정적)
  • 표준편차가 크다 → 데이터가 넓게 퍼져 있음 (변동성 높음)

같은 평균, 다른 표준편차 사례#

시험 평균이 70점이더라도 두 반의 분포가 완전히 다를 수 있습니다.

A반: [65, 68, 70, 72, 75]    평균 70, 표준편차 ≈ 3.6
B반: [40, 50, 70, 90, 100]   평균 70, 표준편차 ≈ 24.5

A반은 점수가 평균 근처에 모여 있고(변별력 낮은 시험),
B반은 매우 넓게 퍼져 있습니다(변별력 큰 시험).

변동계수(CV): 단위가 다른 데이터 비교#

변동계수(CV) = 표준편차 ÷ 평균 × 100%

평균 1억원 자산의 표준편차 1,000만원과
평균 100만원 자산의 표준편차 30만원 중 어느 쪽이 변동성이 큰지 직관이 어렵습니다. 변동계수를 쓰면:

A: 1,000 ÷ 10,000 × 100 = 10%
B:    30 ÷    100 × 100 = 30%

B가 상대적으로 변동성이 더 큽니다.

사분위수와 IQR: 중앙값을 더 깊이#

사분위수(Quartile)#

데이터를 4등분했을 때의 경계값입니다.

사분위수별칭의미
Q125백분위수하위 25% 경계
Q250백분위수중앙값
Q375백분위수상위 25% 시작

IQR(사분위 범위)#

IQR = Q3 − Q1

데이터 중앙 50%가 어느 범위에 있는지를 나타냅니다. 이상값에 강건한 산포도 지표입니다.

이상값 탐지#

하한 이상값: Q1 − 1.5 × IQR 미만
상한 이상값: Q3 + 1.5 × IQR 초과

데이터 정제 시 이상값 자동 탐지 기준으로 사용됩니다.

정규분포와 통계의 70-95-99 법칙#

대부분의 자연·사회 현상은 정규분포(normal distribution)에 가깝습니다. 정규분포에서는 다음과 같은 비율이 성립합니다.

범위포함 비율
평균 ±1 표준편차약 68%
평균 ±2 표준편차약 95%
평균 ±3 표준편차약 99.7%

예: 한국 남성 평균 키 173cm, 표준편차 6cm라면

  • 167–179cm 사이: 약 68%
  • 161–185cm 사이: 약 95%
  • 155–191cm 사이: 약 99.7%

품질 관리(6시그마 = 100만 개 중 3.4개 불량), 시험 등급 산출(상위 X%),
투자 리스크 평가에 모두 이 법칙이 활용됩니다.

실생활 통계 활용#

1. 연봉·소득 통계 읽기#

뉴스 헤드라인 "개발자 평균 연봉 6,500만원"은 다음 함정이 있습니다.

  • 일부 시니어 고연봉자가 평균을 끌어올림
  • 중앙값이 더 대표성 있는 경우가 많음
  • 표준편차로 연봉 분포의 편차 파악 필요

통계청 가계금융복지조사를 보면 평균소득과 중위소득이 함께 공표됩니다. 정책 설계(기초생활수급 기준 등)에는 중위소득이 사용됩니다.

2. 시험 점수 분석#

  • 평균: 전체적인 수준 파악
  • 중앙값: 실제 중간 학생의 수준
  • 표준편차: 점수 분포의 넓이(낮으면 변별력 부족)
  • IQR: 상·하위 25%를 제외한 핵심 50% 범위

3. 주식·투자 변동성#

  • 주가 일일 수익률의 표준편차 = 변동성(volatility)
  • 높은 변동성 = 높은 잠재 수익/손실
  • 연환산 변동성 = 일일 표준편차 × √252(거래일 수)

4. 의료 검사 결과 해석#

검사 수치가 정상 범위(평균 ±2 표준편차)를 벗어나면 비정상으로 판정합니다. 정확한 진단은 의사 상담 필수입니다.

자주 묻는 질문#

Q. 평균은 산술평균만 있나요?

A. 아닙니다. 산술평균(arithmetic mean) 외에도 기하평균(geometric mean, 비율·성장률용),
조화평균(harmonic mean, 속도·비율 평균용), 가중평균(weighted mean, 가중치 적용) 등이 있습니다.
일반적으로 "평균"이라고 하면 산술평균을 의미합니다.

Q. 표본 데이터에서 N−1로 나누는 이유는?

A. 표본은 모집단의 일부이므로, 표본분산은 모분산보다 작게 추정되는 경향이 있습니다. N 대신 N−1로 나누면(베셀 보정) 모분산을 더 정확히 추정합니다.

Q. 데이터에 0이 있을 때 기하평균은?

A. 기하평균은 모든 값을 곱한 후 N제곱근을 구하므로, 0이 포함되면 결과가 0이 됩니다. 음수도 정의되지 않습니다. 이런 데이터에는 산술평균을 사용합니다.

Q. 표본 크기가 작아도(N < 30) 평균을 신뢰할 수 있나요?

A. 일반적으로 N ≥ 30이면 중심극한정리에 의해 표본평균이 정규분포에 가까워집니다. 더 작은 표본은 t-분포를 사용하거나 데이터의 분포를 직접 확인해야 합니다.

Q. 한국에서 사용하는 통계 출처는 어디가 신뢰할 만한가요?

A. 통계청(kostat.go.kr), 한국은행 경제통계시스템(ECOS), 국토교통부 실거래가 공개시스템,
국세청 국세통계연보, KOSIS 국가통계포털이 1차 공식 출처입니다.

통계 계산기로 빠르게 확인하기#

통계 계산기에 숫자 목록을 입력하면
평균·중앙값·최빈값·분산·표준편차·최솟값·최댓값·합계를 즉시 계산할 수 있습니다. 데이터 정제 전 빠른 탐색·검증, 시험 채점, 데이터 분석 과제에 유용합니다.

수학 학습을 더 진행하고 싶다면 순열·조합 완전 정리에서 확률의 기초를,
퍼센트 계산 완전 가이드에서 비율과 증감율을 살펴볼 수 있습니다.

이런 글도 읽어보세요

전체 글 보기

관련 도구