본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

Mean·Median·Mode의 차이: 데이터 분포에 따라 중심값을 선택하는 기준

읽는 시간 약 45분

데이터의 중심을 설명할 때 가장 자주 사용하는 통계량은 Mean, Median, Mode입니다.

세 값은 모두 Data의 대표적인 위치를 설명한다는 공통점이 있지만, 계산 방식과 해석 방식은 서로 다릅니다.

특히 Distribution이 대칭적인지, Skewed되어 있는지, Extreme Value가 존재하는지, Variable이 Continuous인지 Categorical인지에 따라 적절한 중심값이 달라질 수 있습니다.

Mean은 모든 값의 크기를 반영하고, Median은 정렬된 위치를 반영하며, Mode는 가장 자주 나타나는 값을 나타냅니다.

따라서 “평균”이라는 하나의 개념으로 세 통계량을 동일하게 취급하면 안 됩니다.

첨부 교재에서도 Mean은 대칭적인 Interval 또는 Ratio Scale Variable에 적절하고, Median은 Ordinal 또는 Skewed Continuous Data에서 유용하며, Mode는 Nominal Variable에서도 사용할 수 있다고 설명합니다.

Central Tendency란 무엇인가?

Mean, Median, Mode는 모두 Central Tendency, 즉 중심경향을 측정하는 Statistic입니다.

Central Tendency는 Data가 대략 어느 위치에 모여 있는지를 요약합니다.

예를 들어 Score가 다음과 같다고 가정해보겠습니다.

68

70

72

74

76

이 Data의 중심은 대략 72 근처에 있습니다.

여기서 어떤 기준으로 중심을 정의하는지에 따라 Mean, Median, Mode가 달라집니다.

Mean이란 무엇인가?

Mean은 우리가 가장 흔히 말하는 산술평균입니다.

모든 Observation을 더한 뒤 Observation 수로 나눕니다.

예를 들어:

10

20

30

이라면:

10 + 20 + 30 = 60

60 / 3 = 20

따라서 Mean은 20입니다.

개념적으로:

모든 Data Value 합계

Observation 수로 나눔

Mean

입니다.

Mean의 가장 큰 특징은 무엇일까?

Mean은 모든 Observation의 실제 값을 계산에 사용합니다.

따라서 Data 값이 조금만 변해도 Mean이 달라질 수 있습니다.

예를 들어:

10

20

30

의 Mean은 20입니다.

마지막 값 30이 60으로 바뀌면:

10 + 20 + 60 = 90

Mean = 30

이 됩니다.

즉 하나의 Observation 변화가 전체 Mean에 영향을 줍니다.

Mean의 장점은 모든 Data 정보를 반영한다는 것이지만, 바로 그 특성 때문에 Extreme Value에도 민감합니다.

Median이란 무엇인가?

Median은 Data를 작은 값에서 큰 값으로 정렬했을 때 가운데 위치한 값입니다.

예를 들어:

10

20

30

40

50

이라면 가운데 값은 30입니다.

따라서 Median은:

30

입니다.

중요한 점은 Median이 실제 값의 크기보다 순서와 위치를 이용한다는 것입니다.

Observation 수가 짝수이면 Median은 어떻게 계산할까?

예를 들어:

10

20

30

40

처럼 4개의 값이 있다고 가정해보겠습니다.

가운데에는 하나의 값이 아니라:

20

30

두 값이 있습니다.

따라서 두 값의 평균을 계산합니다.

(20 + 30) / 2 = 25

따라서 Median은 25입니다.

Mode란 무엇인가?

Mode는 Data에서 가장 자주 나타나는 값입니다.

예를 들어:

A

A

B

C

A

B

라면:

A가 3회

B가 2회

C가 1회

나타납니다.

따라서 Mode는 A입니다.

Mode의 중요한 특징은 숫자가 아닌 Category에도 적용할 수 있다는 것입니다.

Mean·Median·Mode를 한 번에 비교해보자

가장 간단하게 보면 다음과 같습니다.

Mean

모든 값을 계산

산술적 중심

Median

값을 정렬

가운데 위치

Mode

빈도 계산

가장 자주 나타나는 값

즉 세 통계량은 모두 Center를 표현하지만 Center를 정의하는 기준이 다릅니다.

대칭적인 Data에서는 세 값이 비슷할까?

Distribution이 대칭적이고 하나의 중심에 집중되어 있다면 Mean과 Median이 비슷하게 나타나는 경우가 많습니다.

예를 들어:

10

20

30

40

50

에서는:

Mean = 30

Median = 30

입니다.

만약 30이 여러 번 반복된다면 Mode도 30이 될 수 있습니다.

이런 구조에서는 세 값이 Distribution 중심을 비슷하게 표현할 수 있습니다.

Mean은 언제 특히 유용할까?

첨부 교재에서는 Mean을 Symmetric Interval 또는 Ratio Scale Variable의 위치를 측정하는 데 적절한 Statistic으로 설명합니다.

예를 들어 다음과 같은 Continuous Data가 비교적 대칭적으로 분포한다고 가정할 수 있습니다.

  • Height
  • Weight
  • Test Score
  • Blood Pressure

이런 경우 Mean은 Data Center를 잘 나타낼 수 있습니다.

Skewed Distribution에서는 Mean이 어떻게 달라질까?

Income Data를 생각해보겠습니다.

예:

2,000

2,200

2,500

2,700

20,000

대부분 값은 2,000~2,700 근처에 있습니다.

하지만 20,000이라는 매우 큰 값 하나가 있습니다.

Mean을 계산하면 큰 값의 영향을 강하게 받습니다.

따라서 Mean은 대부분 Observation이 위치한 범위보다 상당히 높아질 수 있습니다.

Median이 Skewed Data에서 유용한 이유

위 Data를 다시 보겠습니다.

2,000

2,200

2,500

2,700

20,000

Median은 가운데 값인:

2,500

입니다.

20,000이 매우 크더라도 가운데 Observation의 위치는 변하지 않습니다.

따라서 Median은 Extreme Value의 영향을 Mean보다 적게 받습니다.

첨부 교재에서도 Median은 Skewed Interval 또는 Ratio Scale Variable과 Ordinal Variable의 위치를 측정하는 데 적절하다고 설명합니다.

Distribution이 Skewed될수록 Mean과 Median의 차이가 커질 수 있으며, 이 차이 자체가 Distribution Shape를 이해하는 단서가 될 수 있습니다.

Right-Skewed Distribution에서는 Mean과 Median의 관계가 어떨까?

Right-Skewed Distribution에서는 높은 Extreme Value가 오른쪽 Tail을 만듭니다.

이 큰 값들이 Mean을 오른쪽으로 끌어당깁니다.

따라서 일반적으로:

Mode

Median

Mean

순서가 나타날 수 있습니다.

단, 모든 Dataset에서 반드시 이 관계가 정확하게 성립한다고 단정하면 안 됩니다.

중요한 원리는 Mean이 높은 Extreme Value의 영향을 더 많이 받는다는 것입니다.

Left-Skewed Distribution에서는 어떻게 될까?

Left-Skewed Distribution에서는 매우 낮은 값이 왼쪽 Tail을 만듭니다.

낮은 Extreme Value가 Mean을 아래쪽으로 끌어당깁니다.

따라서 Mean이 Median보다 낮아지는 경향을 볼 수 있습니다.

즉:

Mean과 Median의 상대적인 위치

를 보면 Distribution의 Skewness에 대한 힌트를 얻을 수 있습니다.

Mean과 Median이 많이 다르면 무엇을 확인해야 할까?

두 값의 차이가 크다면 다음을 확인할 수 있습니다.

  • Distribution이 Skewed되어 있는가?
  • Extreme Value가 존재하는가?
  • Data Entry Error가 있는가?
  • Multiple Population이 섞여 있는가?

예를 들어:

Mean = 85

Median = 54

라면 단순히 Mean만 보고 “대표적인 값은 85다”라고 말하기보다 Distribution을 먼저 확인하는 것이 좋습니다.

Extreme Value가 Mean에 미치는 영향을 예로 보자

Dataset A:

10

11

12

13

14

Mean = 12

Median = 12

입니다.

마지막 값을 100으로 바꿔보겠습니다.

Dataset B:

10

11

12

13

100

Mean은 크게 증가합니다.

하지만 Median은 여전히 12입니다.

즉:

Extreme Value

Mean 크게 변화

Median 상대적으로 안정

이라는 차이가 나타납니다.

Median은 Outlier의 영향을 전혀 받지 않을까?

“전혀 받지 않는다”고 표현하면 정확하지 않습니다.

Median은 Extreme Value의 크기 자체에는 Mean보다 훨씬 덜 민감합니다.

하지만 Data의 구성이나 순서가 크게 달라지면 Median도 달라질 수 있습니다.

즉 Median은 Robust Statistic에 가까운 특성을 갖지만 항상 완전히 고정되는 것은 아닙니다.

Robust Statistic이란 무엇일까?

Robust Statistic은 Extreme Value나 Distribution 이상에 상대적으로 덜 영향을 받는 Statistic을 의미합니다.

Median은 Mean보다 Outlier에 Robust한 대표적인 Statistic입니다.

이 때문에:

  • Income
  • House Price
  • Hospital Stay
  • Transaction Amount

같이 Right-Skewed될 가능성이 높은 Data에서는 Median을 자주 함께 제시합니다.

House Price에서 Median이 자주 사용되는 이유

예를 들어 대부분 주택가격이:

3억~6억 원

범위에 있지만 일부 초고가 주택이:

50억

100억

이라면 Mean은 크게 올라갈 수 있습니다.

Median은 가운데 주택의 가격을 보여주므로 전형적인 주택 가격 수준을 설명하는 데 더 적절할 수 있습니다.

즉 상황에 따라 Mean보다 Median이 실제 사용자 경험과 더 가까운 중심값을 제공할 수 있습니다.

Mean이 높다고 대부분 값도 높은 것은 아니다

Right-Skewed Data에서는 소수의 큰 값이 Mean을 높일 수 있습니다.

예를 들어 회사 직원 10명의 Salary 중 한 명의 Salary가 매우 높다면 Mean Salary가 대부분 직원의 실제 Salary보다 높게 나타날 수 있습니다.

따라서:

“평균 Salary가 1억 원이다.”

라는 문장만으로 대부분 직원이 1억 원 가까이 받는다고 생각하면 안 됩니다.

Median을 함께 확인해야 합니다.

Median은 Ordinal Variable에서도 사용할 수 있다

Ordinal Variable에는 Category 순서가 존재합니다.

예를 들어 Satisfaction이:

1 = Very Dissatisfied

2 = Dissatisfied

3 = Neutral

4 = Satisfied

5 = Very Satisfied

라고 가정해보겠습니다.

Category 사이의 간격이 정확히 동일하다고 보장할 수는 없지만 순서는 존재합니다.

따라서 Data를 정렬하고 가운데 Category를 찾을 수 있습니다.

이 때문에 Median은 Ordinal Data에서 사용할 수 있습니다.

첨부 교재 역시 Median을 Ordinal Variable에 적절한 Measure로 설명합니다.

Nominal Variable에서는 Median을 사용할 수 있을까?

일반적으로 의미가 없습니다.

예를 들어 Blood Type이:

A

B

AB

O

라면 Category 사이에 자연스러운 Order가 없습니다.

따라서 “가운데 Blood Type”이라는 개념을 정의하기 어렵습니다.

이 경우 Frequency와 Mode가 더 적절합니다.

Mode가 Nominal Data에서 중요한 이유

Mode를 계산하는 데는 값 사이의 크기나 순서가 필요하지 않습니다.

단지 가장 많이 나타나는 Category만 찾으면 됩니다.

예를 들어:

Blood Type

A = 40명

B = 20명

AB = 10명

O = 30명

이라면 Mode는 A입니다.

따라서 Mode는 Nominal Variable에서도 자연스럽게 사용할 수 있습니다.

첨부 교재에서도 Mode를 Nominal Variable의 위치를 측정하는 데 적절한 Statistic으로 설명합니다.

Mode는 Numeric Variable에서도 사용할 수 있을까?

가능합니다.

예를 들어 Shoe Size가:

250

255

260

260

260

265

이라면 Mode는 260입니다.

하지만 Continuous Data에서는 동일한 정확한 값이 반복되지 않을 수 있어 Mode가 별로 유용하지 않은 경우도 있습니다.

따라서 Mode의 활용도는 Data 특성에 따라 달라집니다.

Mode가 두 개일 수도 있을까?

가능합니다.

예를 들어:

1

1

2

3

3

이라면:

1과 3이 각각 두 번씩 나타납니다.

이 경우 두 개의 Mode를 가질 수 있습니다.

이를 Bimodal이라고 표현할 수 있습니다.

Mode가 여러 개면 무엇을 의미할까?

Data가 여러 Subgroup으로 구성되어 있을 가능성을 생각해볼 수 있습니다.

예를 들어 Height Distribution에서 두 Peak가 있다면 서로 다른 Population이 섞여 있을 수도 있습니다.

하지만 여러 Mode가 있다는 사실만으로 원인을 단정할 수는 없습니다.

Histogram 등 Distribution Plot을 함께 확인해야 합니다.

Mode가 없을 수도 있을까?

모든 값이 한 번씩만 나타난다면 명확한 Mode가 없다고 볼 수 있습니다.

예:

10

20

30

40

50

모든 값의 Frequency가 동일합니다.

따라서 가장 자주 나타난 값이 하나 존재하지 않습니다.

Mean·Median·Mode와 Measurement Scale의 관계

Measurement Scale을 기준으로 정리하면 다음과 같이 생각할 수 있습니다.

Nominal

Mode

Ordinal

Median

Mode

Interval / Ratio

Mean

Median

Mode

등을 고려할 수 있습니다.

하지만 단순히 “가능한 통계량”만 보는 것이 아니라 Distribution Shape와 분석 목적도 함께 확인해야 합니다.

Mean을 Nominal Variable에 계산하면 왜 문제가 될까?

예를 들어 Region을 다음처럼 Coding했다고 가정해보겠습니다.

1 = Korea

2 = USA

3 = Japan

Sample Mean Region Code가:

1.8

이라고 계산되었다고 합시다.

1.8이라는 값은 실제 Region Category가 아닙니다.

또 Coding을 바꾸면 Mean도 달라집니다.

따라서 Nominal Code의 Mean은 Category의 중심을 의미하지 않습니다.

Ordinal Variable에서 Mean은 절대 사용할 수 없을까?

실제 연구에서는 여러 Level의 Ordinal Scale을 숫자로 Coding하여 Mean을 제시하는 경우가 있습니다.

하지만 이때는 Category 사이의 Distance가 어느 정도 동일하다고 보는 추가적인 해석이 들어갈 수 있습니다.

따라서 단순히 숫자로 Coding되어 있다는 이유만으로 Mean을 사용하는 것은 신중해야 합니다.

특히 단일 Ordinal Item에서는 Median이나 Frequency Distribution이 Scale의 원래 구조를 더 충실히 보여줄 수 있습니다.

Likert Scale에서는 무엇을 봐야 할까?

예를 들어:

1 = Strongly Disagree

2 = Disagree

3 = Neutral

4 = Agree

5 = Strongly Agree

라는 단일 Item이 있다고 가정해보겠습니다.

이 Data는 Ordinal 구조를 가집니다.

따라서:

  • Frequency
  • Percentage
  • Median
  • Mode

등을 사용할 수 있습니다.

실무에서 Mean Score를 제시하는 경우도 있지만 Category 간 간격에 대한 Assumption을 인식해야 합니다.

Mean의 가장 중요한 장점은 무엇일까?

Mean은 모든 Observation의 정보를 사용합니다.

예를 들어 Data가:

10

20

30

40

50

일 때 각 값 모두 Mean 계산에 직접 기여합니다.

따라서 대칭적인 Continuous Data에서는 전체 Data 위치를 효율적으로 요약할 수 있습니다.

또 Mean은 Variance, Standard Deviation, t-Test, ANOVA, Regression 등 많은 Statistical Method의 계산과 직접 연결됩니다.

Mean이 Inferential Statistics에서 중요한 이유

Population Mean μ를 Sample Mean x̄로 추정할 수 있습니다.

그리고 Sample Mean을 이용하여:

  • Standard Error
  • Confidence Interval
  • t-Test
  • ANOVA

등을 수행할 수 있습니다.

즉 Mean은 단순한 Descriptive Statistic을 넘어 Inferential Statistics의 핵심 Statistic입니다.

Median도 Population Parameter를 추정할 수 있을까?

물론 Population Median이라는 개념이 있습니다.

Sample Median을 이용해 Population Median을 추정할 수 있습니다.

특히 Skewed Distribution에서는 Median이 Population의 Typical Center를 설명하는 중요한 Parameter가 될 수 있습니다.

따라서 Mean만이 Inferential 대상이 되는 것은 아닙니다.

Mean과 Median은 질문에 따라 선택해야 한다

예를 들어 다음 두 질문은 다릅니다.

질문 A

전체 금액을 사람 수로 나누었을 때 평균적으로 얼마인가?

Mean

질문 B

사람들을 금액순으로 정렬했을 때 가운데 사람은 얼마인가?

Median

두 Statistic은 서로 다른 의미의 Center를 제공합니다.

따라서 어느 하나가 항상 더 좋은 Statistic이라고 할 수 없습니다.

“평균적인 사람”이라는 표현은 조심해야 한다

Mean을 계산했다고 해서 Mean 값과 정확히 같은 Observation이 실제로 존재할 필요는 없습니다.

예를 들어 자녀 수가:

0

1

1

2

3

이라면 Mean은:

1.4명

일 수 있습니다.

하지만 실제 어떤 가족도 자녀 1.4명을 가지고 있지는 않습니다.

Mean은 Data의 Arithmetic Center이지 반드시 실제 Observation을 의미하지는 않습니다.

Median은 실제 Observation일까?

Observation 수가 홀수이면 가운데 실제 Observation이 Median이 됩니다.

하지만 Observation 수가 짝수이면 가운데 두 값의 평균으로 계산할 수 있기 때문에 실제 Data에 존재하지 않는 값이 Median이 될 수도 있습니다.

예:

20

30

40

50

Median = 35

실제 Observation에는 35가 없습니다.

따라서 Median 역시 항상 실제 Data Value라는 의미는 아닙니다.

Mode는 실제 Observation이어야 할까?

Mode는 실제로 가장 많이 나타난 값이므로 일반적으로 관찰된 Category 또는 Value입니다.

이 점은 Mean과 Median과의 차이입니다.

예를 들어 Shoe Size의 Mode가 260이라면 실제로 260이 여러 번 관찰된 것입니다.

Mean과 Median을 함께 보고 Distribution을 추정할 수 있을까?

어느 정도 힌트를 얻을 수 있습니다.

Mean ≈ Median

대칭적인 Distribution 가능성

Mean > Median

Right Skew 가능성

Mean < Median

Left Skew 가능성

하지만 이것만으로 Distribution Shape를 완전히 판단해서는 안 됩니다.

Histogram이나 Box Plot을 함께 확인해야 합니다.

Mean·Median·Mode만으로 Distribution을 알 수 있을까?

충분하지 않습니다.

예를 들어 두 Dataset이 같은 Mean과 Median을 가질 수 있지만 Spread가 완전히 다를 수 있습니다.

따라서 Center와 함께 다음을 확인해야 합니다.

  • Standard Deviation
  • Range
  • IQR
  • Quartile
  • Histogram
  • Box Plot

즉:

Center

Spread

Shape

를 함께 봐야 Data를 제대로 이해할 수 있습니다.

같은 Mean을 가진 두 Group을 비교해보자

Group A:

48

49

50

51

52

Group B:

0

25

50

75

100

두 Group Mean은 모두 50입니다.

Median도 모두 50일 수 있습니다.

하지만 Group B의 Variability가 훨씬 큽니다.

따라서 Mean과 Median이 같다는 사실만으로 두 Group Distribution이 같다고 할 수 없습니다.

Mean을 비교하기 전에 Group별 N도 봐야 한다

예를 들어:

Group A Mean = 70, n = 1,000

Group B Mean = 72, n = 5

라고 가정해보겠습니다.

단순히 72가 더 높다는 사실만으로 안정적인 Group Comparison을 할 수 없습니다.

Group B의 Sample Size가 매우 작기 때문입니다.

따라서 Center Statistic과 함께 N과 Spread를 확인해야 합니다.

Missing Value가 Mean 계산에 영향을 줄까?

그렇습니다.

특정 Observation이 Missing이라면 Mean 계산에 사용되는 N이 줄어들 수 있습니다.

예를 들어 전체 Sample이 100명인데 Score가 20명 Missing이면 Score Mean은 80명을 기반으로 계산될 수 있습니다.

따라서 Mean만 보는 것이 아니라:

N

Missing N

을 함께 확인해야 합니다.

Missing이 특정 Group에 집중되어 있다면?

더 중요한 문제가 됩니다.

예를 들어 Treatment A에서는 Missing이 2%인데 Treatment B에서는 30%라면 Group Mean 비교가 영향을 받을 수 있습니다.

즉 Mean의 차이가 실제 Treatment Difference인지 Missing Pattern과 관련된 것인지 검토해야 합니다.

Extreme Value를 발견하면 Mean 대신 Median을 쓰면 끝일까?

그렇지 않습니다.

먼저 Extreme Value가 무엇인지 확인해야 합니다.

Case 1

Data Entry Error

Source 확인 및 적절한 Correction 필요

Case 2

실제 Observation

Distribution 특성으로 인정

Mean과 Median을 함께 제시할 수 있음

단순히 Mean이 영향을 받는다고 Median으로 바꾸고 Error를 무시하면 안 됩니다.

평균을 계산하기 전에 Unit을 확인해야 한다

예를 들어 Weight Data가:

70

75

80

인데 어떤 Observation은 kg이고 다른 Observation은 lb라고 가정해보겠습니다.

Mean을 계산해도 의미가 없습니다.

따라서 Mean은 Data Unit이 동일하다는 전제가 필요합니다.

이는 모든 Quantitative Summary Statistic에 해당합니다.

서로 다른 Scale을 섞으면 Mean이 무의미해질 수 있다

Test Score A는 0~100이고 Test Score B는 0~1이라고 가정해보겠습니다.

두 Score를 그대로 합쳐 Mean을 내면 해석이 어려울 수 있습니다.

따라서 Variable Definition과 Scale을 먼저 확인해야 합니다.

Derived Score의 Mean도 해석을 확인해야 한다

예를 들어 Change from Baseline을:

Follow-up – Baseline

으로 정의했다고 가정해보겠습니다.

Mean Change = -5라면 평균적으로 5점 감소했다는 의미일 수 있습니다.

하지만 Score에서 감소가 Improvement인지 Worsening인지 Scale Direction을 확인해야 합니다.

숫자 자체만으로 해석하면 안 됩니다.

Mean의 Sign이 무엇을 의미하는지도 확인해야 한다

예를 들어 Change Score가 음수라고 해서 항상 나쁜 것은 아닙니다.

Pain Score에서:

Baseline 8

Follow-up 4

Change = -4

라면 감소는 Improvement일 수 있습니다.

반대로 Cognitive Score에서 Scale Direction이 다르면 감소가 Worsening일 수 있습니다.

따라서 Center Statistic을 해석할 때 Variable Definition이 필수입니다.

Median에서도 Scale Direction이 중요하다

Ordinal Severity가:

1 = Severe

2 = Moderate

3 = Mild

라면 Median = 3은 Mild를 의미합니다.

하지만 Coding이 반대로:

1 = Mild

2 = Moderate

3 = Severe

라면 같은 Median 3은 Severe를 의미합니다.

따라서 Statistic 숫자만 보는 것이 아니라 Coding을 확인해야 합니다.

Mode도 Coding Label을 함께 봐야 한다

Binary Variable에서:

0

1

만 있다면 Mode = 1이라고 나올 수 있습니다.

하지만:

1 = Success

인지

1 = Failure

인지 알아야 해석할 수 있습니다.

즉 Categorical Statistic에서는 Category Label이 중요합니다.

Bimodal Distribution이 특별한 이유

두 개의 Peak가 있는 Distribution에서는 Mean이 실제로 어느 Group도 대표하지 못할 수 있습니다.

예를 들어:

Group 1은 30 근처

Group 2는 70 근처

에 몰려 있는데 전체 Mean이 50이라고 가정해보겠습니다.

실제로 50 근처 Observation은 거의 없을 수 있습니다.

이런 경우 Mean 하나로 전체 Population을 설명하면 중요한 Subgroup Structure를 놓칠 수 있습니다.

대표값 하나는 Data를 단순화하지만 때로는 중요한 구조까지 숨길 수 있습니다.

전체 Mean이 Subgroup 차이를 숨길 수도 있다

예를 들어 Male과 Female의 Height Distribution이 서로 다르다고 가정해보겠습니다.

전체 Mean만 제시하면 두 Group 차이를 알기 어렵습니다.

따라서 연구 목적에 따라:

  • Overall Mean
  • Group-specific Mean

을 함께 확인할 수 있습니다.

이는 ANOVA와 Regression으로 넘어갈 때 중요한 개념입니다.

Weighted Mean이란 무엇인가?

각 Observation이나 Group이 동일한 Weight를 가지지 않을 때 Weighted Mean을 사용할 수 있습니다.

예를 들어 두 Class의 평균이:

Class A: Mean 80, n=10

Class B: Mean 70, n=90

이라고 가정해보겠습니다.

단순히:

(80 + 70) / 2 = 75

라고 계산하면 두 Class 규모를 무시합니다.

전체 학생 평균을 구하려면 Sample Size를 반영한 Weighted Mean이 필요합니다.

Group Mean의 단순 평균이 전체 Mean과 다른 이유

위 예에서:

Class A Total Score = 80 × 10

Class B Total Score = 70 × 90

전체 Mean은:

각 Group의 Observation 수를 반영해야 합니다.

Mean of Means를 단순히 계산하면 안 되는 경우가 있습니다.

Trimmed Mean이란 무엇일까?

Extreme Value 영향을 줄이기 위해 Data의 양쪽 일정 비율을 제거한 뒤 Mean을 계산하는 방법이 있습니다.

이를 Trimmed Mean이라고 합니다.

Mean과 Median 사이의 성격을 가진 Robust Summary로 활용될 수 있습니다.

다만 어떤 비율을 제거할지는 분석 목적에 따라 결정해야 합니다.

Geometric Mean은 Arithmetic Mean과 다를까?

그렇습니다.

우리가 일반적으로 Mean이라고 할 때는 Arithmetic Mean을 의미하는 경우가 많습니다.

하지만 Growth Rate나 특정 Positive Skewed Measurement에서는 Geometric Mean을 사용하는 경우도 있습니다.

따라서 “Mean”이라는 단어 자체도 Analysis Context에 따라 어떤 평균인지 확인해야 할 수 있습니다.

이 글에서는 첨부 교재의 Central Tendency 구조에 맞추어 Arithmetic Mean을 중심으로 설명합니다.

SAS Enterprise Guide에서는 Mean·Median·Mode를 확인할 수 있을까?

가능합니다.

Summary Statistics Task와 Frequency 관련 기능을 이용해 Variable 특성에 맞는 Statistic을 생성할 수 있습니다.

Continuous Variable에서는:

  • Mean
  • Median
  • Quartile
  • Standard Deviation

등을 확인할 수 있고,

Categorical Variable에서는 Frequency Table을 통해 가장 자주 나타난 Category를 확인할 수 있습니다.

Mean만 기본 출력된다고 Mean이 항상 최선은 아니다

Software에서 Mean이 기본 Statistic으로 제공될 수 있습니다.

하지만 기본값으로 제공된다는 이유만으로 모든 Variable에 적절하다는 의미는 아닙니다.

분석자는 먼저:

Measurement Scale

Distribution

Analysis Purpose

를 확인해야 합니다.

그 다음 Mean, Median, Mode 가운데 적절한 Statistic을 선택합니다.

SAS 결과에서 Mean과 Median 차이가 크면 무엇을 해야 할까?

다음 단계로 Distribution을 확인하는 것이 좋습니다.

예를 들어:

Mean = 100

Median = 60

이라면:

Histogram

Skewness 확인

Box Plot

Extreme Value 확인

Minimum / Maximum

비정상 값 확인

등으로 이어질 수 있습니다.

즉 Summary Statistic은 추가적인 Data Exploration을 유도하는 신호입니다.

중심값 선택의 기본 구조

간단하게 다음과 같이 생각할 수 있습니다.

Variable은 Categorical인가?

Yes

Order가 없는 Nominal?

Mode / Frequency

Order가 있는 Ordinal?

Median / Mode / Frequency

No, Quantitative

Distribution이 비교적 Symmetric?

Mean

Distribution이 Skewed하거나 Extreme Value 영향이 큰가?

Median 고려

하지만 실제 분석에서는 Sample Size, 연구 목적, Reporting Convention 등을 추가로 고려해야 합니다.

Mean과 Median을 둘 다 보고하는 것이 좋은 경우

Skewed Data에서는 Mean과 Median을 함께 제시하면 Distribution을 더 잘 이해할 수 있습니다.

예를 들어:

Mean Length of Stay = 12.8 days

Median = 7 days

라고 하면 Hospital Stay가 Right-Skewed되어 있을 가능성을 생각할 수 있습니다.

Mean만 제시하면 Typical Patient가 13일 정도 입원한다고 오해할 수 있습니다.

Mean ± SD는 언제 많이 사용할까?

비교적 Symmetric한 Continuous Data에서는 다음과 같은 표현을 자주 사용합니다.

Mean ± Standard Deviation

예:

68.2 ± 7.4 years

이 표현은 Center와 Spread를 동시에 보여줍니다.

하지만 강하게 Skewed한 Data에서는 Median과 IQR이 더 적절할 수 있습니다.

Median과 IQR은 왜 함께 사용될까?

Median은 Center의 Robust Measure이고 IQR은 중앙 50% Data의 Spread를 나타냅니다.

둘 다 Extreme Value에 Mean과 SD보다 상대적으로 덜 민감합니다.

따라서 Skewed Distribution에서는:

Median [Q1, Q3]

또는

Median (IQR)

형태의 Summary를 자주 고려할 수 있습니다.

Mean과 SD를 기계적으로 사용하면 안 되는 이유

모든 Numeric Variable에:

Mean ± SD

를 적용하는 것은 좋은 습관이 아닐 수 있습니다.

예를 들어:

  • 매우 Skewed Income
  • Count Variable
  • Floor/Ceiling이 강한 Score
  • Extreme Value가 많은 Duration

에서는 Distribution을 먼저 확인해야 합니다.

Statistical Reporting은 Variable Type과 Distribution을 반영해야 합니다.

Floor Effect란 무엇일까?

Score의 많은 Observation이 가능한 최소값 근처에 몰려 있는 현상입니다.

예를 들어 Scale 범위가:

0~10

인데 대부분:

0

1

2

에 몰려 있다면 Distribution이 비대칭적일 수 있습니다.

Mean만으로 Distribution을 설명하기 어려울 수 있습니다.

Ceiling Effect란 무엇일까?

반대로 많은 Observation이 가능한 최대값 근처에 몰리는 현상입니다.

예를 들어 시험이 너무 쉬워 대부분 95~100점을 받는다면 Ceiling Effect가 나타날 수 있습니다.

이 경우 Mean과 Median이 비슷하더라도 Distribution Shape와 Measurement Sensitivity를 함께 봐야 합니다.

Mean·Median·Mode와 Distribution Shape의 전체 관계

다음처럼 정리할 수 있습니다.

Symmetric Continuous Data

Mean과 Median이 비슷할 가능성

Mean 활용 용이

Skewed Continuous Data

Mean이 Tail 방향으로 영향을 받음

Median 유용

Ordinal Data

Order는 존재

Median / Mode 고려

Nominal Data

Order 없음

Mode / Frequency 활용

첨부 교재에서도 이러한 Measurement Scale과 Center Statistic의 연결을 설명합니다.

흔한 오해 정리

“Mean이 가장 정확한 대표값이다”

항상 그렇지는 않습니다.

Skewed Data에서는 Median이 더 적절할 수 있습니다.

“Median은 Outlier가 있어도 절대 변하지 않는다”

아닙니다.

Mean보다 덜 민감하지만 Data의 순서와 구성 변화에 따라 Median도 달라질 수 있습니다.

“Mode는 숫자에만 사용할 수 있다”

아닙니다.

Nominal Category에서도 사용할 수 있습니다.

“Nominal Variable도 숫자로 Coding되어 있으면 Mean을 계산할 수 있다”

수학적으로 계산할 수 있어도 Statistical Meaning이 없을 수 있습니다.

“Mean과 Median이 같으면 Normal Distribution이다”

반드시 그렇지는 않습니다.

Distribution Shape를 Plot으로 추가 확인해야 합니다.

“Mean이 Median보다 크면 무조건 오류가 있다”

아닙니다.

Right-Skewed Distribution의 자연스러운 특성일 수 있습니다.

“Outlier가 있으면 Median으로 바꾸면 문제가 해결된다”

아닙니다.

Outlier가 Error인지 실제 Observation인지 먼저 확인해야 합니다.

“Mode가 두 개면 Data가 잘못된 것이다”

아닙니다.

Bimodal Distribution일 수 있으며 Subgroup Structure를 확인할 필요가 있습니다.

“Mean이 동일하면 두 Group이 비슷하다”

아닙니다.

Spread와 Distribution Shape가 완전히 다를 수 있습니다.

중심값을 선택하는 전체 과정

Data를 받았다면 다음 순서를 사용할 수 있습니다.

Variable Type 확인

Measurement Scale 확인

Distribution 확인

Symmetry / Skewness

Extreme Value 확인

Center Statistic 선택

Mean / Median / Mode

Spread Statistic 선택

SD / IQR 등

Visualization 확인

최종 Interpretation

좋은 대표값은 Formula가 가장 익숙한 Statistic이 아니라 Data의 실제 구조를 가장 잘 설명하는 Statistic입니다.

왜 Mean·Median·Mode를 정확히 구분해야 할까?

이후 Statistical Analysis에서는 Mean이 매우 자주 등장합니다.

예를 들어:

Confidence Interval

Mean Estimate

t-Test

Mean Difference

ANOVA

여러 Group Mean 비교

Regression

Conditional Mean Modeling

으로 연결됩니다.

반면 Data가 Skewed하거나 Measurement Scale이 Mean 사용에 적절하지 않다면 다른 Summary Method를 고려해야 합니다.

따라서 Mean을 계산하는 방법보다 Mean을 사용해도 되는 상황과 사용하면 오해가 생길 수 있는 상황을 이해하는 것이 더 중요합니다.

핵심 정리

Mean, Median, Mode는 모두 Data의 Central Tendency를 설명하지만 서로 다른 방식으로 Center를 정의합니다.

Mean

모든 Observation의 실제 값을 이용

Continuous Data에서 강력하지만 Extreme Value에 민감

Median

정렬된 Data의 가운데 위치

Ordinal 또는 Skewed Continuous Data에서 유용

Mode

가장 자주 나타나는 값

Nominal Data에서도 사용 가능

첨부 교재에서는 Mean을 Symmetric Interval 또는 Ratio Variable, Median을 Ordinal 또는 Skewed Interval/Ratio Variable, Mode를 Nominal Variable의 위치를 설명하는 데 적절한 Statistic으로 제시합니다.

전체 선택 구조를 단순화하면 다음과 같습니다.

Nominal

Mode / Frequency

Ordinal

Median / Mode

Symmetric Continuous

Mean

Skewed Continuous

Median 고려

하지만 Center 하나만으로 Data를 설명해서는 부족합니다.

반드시:

Center

Spread

Distribution Shape

를 함께 확인해야 합니다.

Mean·Median·Mode 중 어떤 값이 가장 적절한지는 계산 편의성이 아니라 Measurement Scale과 Distribution이 결정합니다.

함께 읽으면 좋은 글

  • Descriptive Statistics의 목적: 본격적인 분석 전에 데이터를 진단해야 하는 이유
  • Variance와 Standard Deviation의 의미: 평균만으로 데이터 변동성을 설명할 수 없는 이유
  • Range와 Interquartile Range의 차이: 이상치 영향을 줄여 산포를 측정하는 방법
  • Distribution을 먼저 확인해야 하는 이유: 데이터의 위치·산포·형태를 점검하는 과정
  • Skewness와 Extreme Value의 영향: 비대칭 분포와 극단값이 통계량을 왜곡하는 방식

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Introduction to Statistics
  • Descriptive Statistics
  • Measures of Central Tendency
  • Mean, Median and Mode
  • Measurement Scales and Statistical Summaries

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.