Variance와 Standard Deviation의 의미: 평균만으로 데이터 변동성을 설명할 수 없는 이유
데이터를 요약할 때 가장 먼저 확인하는 값은 보통 Mean입니다.
하지만 Mean이 같다고 해서 두 Dataset이 같은 특성을 가진 것은 아닙니다.
예를 들어 다음 두 Dataset을 비교해보겠습니다.
Dataset A
48
49
50
51
52
Dataset B
10
30
50
70
90
두 Dataset의 Mean은 모두 50입니다.
하지만 실제 Data가 퍼져 있는 정도는 완전히 다릅니다.
Dataset A는 50 근처에 값이 집중되어 있지만 Dataset B는 매우 넓게 퍼져 있습니다.
Mean은 Data의 중심을 알려주지만, Observation들이 그 중심에서 얼마나 떨어져 있는지는 알려주지 않습니다.
이 차이를 설명하기 위해 사용하는 대표적인 통계량이 Variance와 Standard Deviation입니다.
첨부 교재에서도 Range, Interquartile Range, Variance, Standard Deviation을 Distribution의 Spread 또는 Dispersion을 설명하는 Measure로 제시하며, Variance는 Mean 주변의 Data Dispersion을 측정하고 Standard Deviation은 Variance의 Square Root로서 원래 Data와 같은 단위로 표현된다고 설명합니다.
Dispersion이란 무엇인가?
Dispersion은 Data가 중심 주변에서 얼마나 퍼져 있는지를 의미합니다.
한국어로는 산포 또는 변동성이라고 표현할 수 있습니다.
예를 들어 두 Class의 평균 시험점수가 모두 80점이라고 가정해보겠습니다.
Class A
78
79
80
81
82
Class B
40
60
80
100
120
두 Class의 Mean은 같지만 학생들의 점수 분포는 전혀 다릅니다.
Class A에서는 대부분의 학생이 평균 근처에 있습니다.
Class B에서는 점수 차이가 훨씬 큽니다.
즉 Mean만 보면 두 Class가 비슷해 보이지만 Spread를 보면 중요한 차이를 발견할 수 있습니다.
왜 평균만으로 Data를 설명할 수 없을까?
Mean은 Data의 Location을 나타냅니다.
하지만 Data에는 위치 외에도 다른 특징이 존재합니다.
대표적으로:
- Spread
- Shape
- Skewness
- Extreme Value
가 있습니다.
첨부 교재에서도 Descriptive Statistics의 목적 가운데 하나로 Continuous Variable의 Spread와 Shape를 확인하는 것을 제시합니다.
따라서 Data를 이해하려면:
Center
Spread
Shape
를 함께 봐야 합니다.
Variance란 무엇인가?
Variance는 각 Observation이 Mean에서 얼마나 떨어져 있는지를 이용하여 Data의 Dispersion을 측정합니다.
첨부 교재에서는 Variance를:
Mean 주변에서 Data가 얼마나 퍼져 있는지를 나타내는 Measure
로 정의합니다.
기본 아이디어는 다음과 같습니다.
Observation
↓
Mean과의 차이 계산
↓
차이를 제곱
↓
제곱된 차이를 종합
↓
Variance
즉 Mean에서 멀리 떨어진 Observation이 많을수록 Variance는 커지는 경향이 있습니다.
왜 Mean에서의 차이를 이용할까?
예를 들어 Data가 다음과 같다고 가정해보겠습니다.
40
50
60
Mean은 50입니다.
각 값과 Mean의 차이는:
40 – 50 = -10
50 – 50 = 0
60 – 50 = 10
입니다.
이 차이를 보면 각 Observation이 Center에서 얼마나 떨어져 있는지 알 수 있습니다.
즉 Spread를 측정하려면 Mean을 기준점으로 사용하는 것이 자연스럽습니다.
그런데 차이를 그대로 더하면 왜 안 될까?
위 Difference를 그대로 더해보겠습니다.
-10 + 0 + 10 = 0
입니다.
Data는 분명 Mean 주변에 퍼져 있는데 합계는 0이 됩니다.
이는 Mean의 중요한 성질과 연결됩니다.
첨부 교재에서도 각 Data Value와 Sample Mean 사이의 Difference를 모두 더하면 0이 된다고 설명합니다.
즉 단순 Difference의 합으로는 Spread를 측정할 수 없습니다.
왜 Difference를 제곱할까?
Negative Difference와 Positive Difference가 서로 상쇄되는 문제를 해결하기 위해 Difference를 제곱합니다.
예를 들어:
-10² = 100
0² = 0
10² = 100
이 됩니다.
이제 모두 0 이상이므로 서로 상쇄되지 않습니다.
따라서:
Mean과의 Distance
↓
Square
↓
모든 값 Positive
↓
Dispersion 측정
이라는 구조가 만들어집니다.
Sample Variance의 기본 구조
첨부 교재에서는 Sample Variance를 다음 형태로 제시합니다.
각 Observation과 Sample Mean의 Difference를 제곱
↓
모두 합산
↓
n – 1로 나눔
↓
Sample Variance
즉 Sample Variance는 단순한 거리의 평균이 아니라 Squared Deviation을 기반으로 한 Spread Measure입니다.
왜 n이 아니라 n-1로 나눌까?
Sample Variance는 Population Variance를 추정하기 위한 Statistic입니다.
Sample 안에서 이미 Sample Mean을 추정하는 데 하나의 정보를 사용했기 때문에 Variance 계산에서는 일반적으로 n-1 Degrees of Freedom을 사용합니다.
쉽게 표현하면:
Population Mean을 알고 있는 것이 아니라
↓
Sample Mean을 먼저 계산
↓
그 Sample Mean을 기준으로 Variance를 추정
하기 때문에 하나의 자유도가 사용됩니다.
따라서 Sample Variance에서는 n이 아니라 n-1을 사용합니다.
Population Variance와 Sample Variance는 어떻게 다를까?
Population의 Variance는 일반적으로:
σ²
로 표현합니다.
Sample Variance는:
s²
로 표현합니다.
즉:
Population
↓
Variance = σ²
반면:
Sample
↓
Variance = s²
입니다.
Sample Variance는 Population Variance를 추정하기 위한 Statistic으로 사용됩니다.
Variance가 크다는 것은 무엇을 의미할까?
Variance가 크다는 것은 Observation들이 Mean에서 상대적으로 멀리 퍼져 있다는 의미입니다.
예를 들어:
Dataset A
49
50
51
Dataset B
0
50
100
두 Dataset의 Mean은 모두 50입니다.
하지만 Dataset B에서 각 Observation은 Mean에서 훨씬 멀리 떨어져 있습니다.
따라서 Dataset B의 Variance가 더 큽니다.
Variance가 0이면 무엇을 의미할까?
모든 Observation이 동일하다면 Variance는 0입니다.
예를 들어:
50
50
50
50
이라면 Mean도 50이고 모든 Observation과 Mean의 Difference가 0입니다.
따라서 Variance도 0입니다.
즉:
Variance = 0
↓
모든 값 동일
↓
Data Spread 없음
이라고 이해할 수 있습니다.
Variance가 음수가 될 수 있을까?
일반적인 Variance는 음수가 될 수 없습니다.
왜냐하면 Mean과의 Difference를 제곱하기 때문입니다.
Squared Difference는 항상 0 이상입니다.
따라서:
Variance ≥ 0
입니다.
Variance의 가장 큰 해석상 단점은 무엇일까?
Variance는 원래 Data의 Unit이 아니라 Unit의 제곱으로 표현됩니다.
예를 들어 Height가 cm 단위라면:
Height
↓
cm
하지만 Variance는:
cm²
가 됩니다.
Weight가 kg이면 Variance는:
kg²
입니다.
이 때문에 Variance는 Mathematical Modeling에서는 매우 중요하지만 실제 Data Interpretation에서는 다소 직관적이지 않을 수 있습니다.
Standard Deviation이란 무엇인가?
Standard Deviation은 Variance의 Square Root입니다.
즉:
Variance
↓
Square Root
↓
Standard Deviation
입니다.
첨부 교재에서도 Standard Deviation을 Variance의 Square Root이며 Data와 동일한 Measurement Unit으로 표현되는 Dispersion Measure라고 설명합니다.
왜 Standard Deviation을 사용할까?
가장 큰 이유는 원래 Data와 같은 Unit으로 돌아오기 때문입니다.
예를 들어 Weight가 kg라면:
Variance = kg²
Standard Deviation = kg
입니다.
따라서:
Mean Weight = 70 kg
Standard Deviation = 5 kg
처럼 해석할 수 있습니다.
이는 Variance가 25 kg²이라고 표현하는 것보다 훨씬 직관적입니다.
Variance는 변동성을 수학적으로 표현하고, Standard Deviation은 그 변동성을 원래 Data의 단위로 다시 표현한다고 이해하면 쉽습니다.
Standard Deviation이 작다는 것은 무엇을 의미할까?
Standard Deviation이 작다면 Observation들이 Mean 주변에 비교적 밀집되어 있다는 의미입니다.
예를 들어:
Mean = 100
SD = 2
라면 많은 값이 Mean 근처에 위치할 가능성이 있습니다.
반면:
Mean = 100
SD = 40
이라면 Data가 Mean을 중심으로 훨씬 넓게 퍼져 있을 수 있습니다.
같은 Mean, 다른 Standard Deviation의 예
두 Group을 비교해보겠습니다.
Group A
Mean = 70
SD = 3
Group B
Mean = 70
SD = 20
Mean만 보면 두 Group은 동일합니다.
하지만 Standard Deviation을 보면 Group B가 훨씬 큰 Variability를 가지고 있음을 알 수 있습니다.
즉:
Mean
↓
어디에 위치하는가?
Standard Deviation
↓
얼마나 퍼져 있는가?
를 설명합니다.
Mean과 Standard Deviation은 왜 함께 보고할까?
두 Statistic이 서로 다른 정보를 제공하기 때문입니다.
예를 들어:
68.2 ± 7.4 years
라고 보고하면:
Mean Age = 68.2 years
그리고
SD = 7.4 years
라는 정보를 동시에 전달할 수 있습니다.
즉 Data의 Center와 Spread를 함께 요약할 수 있습니다.
첨부 교재에서도 Variance와 Standard Deviation은 일반적으로 Mean이 적절한 Central Tendency Measure인 상황에서 함께 보고한다고 설명합니다.
Mean ± SD는 모든 Data에서 좋은 표현일까?
아닙니다.
Distribution이 강하게 Skewed되어 있거나 Extreme Outlier가 여러 개 존재하면 Mean과 Standard Deviation이 Data를 잘 대표하지 못할 수 있습니다.
첨부 교재에서도:
- Skewed Distribution
- Several Extreme Outliers
- Ordinal Variable
에서는 Variance와 Standard Deviation보다 Interquartile Range가 더 적절할 수 있다고 설명합니다.
따라서 Mean ± SD는 기계적으로 모든 Numeric Variable에 적용하면 안 됩니다.
Standard Deviation도 Outlier의 영향을 받을까?
그렇습니다.
Standard Deviation은 Squared Difference를 기반으로 하기 때문에 Extreme Value의 영향을 크게 받을 수 있습니다.
예를 들어:
10
11
12
13
14
에서는 Spread가 작습니다.
하지만 마지막 값이 100으로 바뀌면:
10
11
12
13
100
Mean뿐 아니라 Variance와 Standard Deviation도 크게 증가합니다.
특히 제곱 과정 때문에 큰 Difference가 더 강하게 반영됩니다.
왜 제곱하면 Outlier 영향이 더 커질까?
예를 들어 Mean에서 각각:
2
와
20
떨어진 Observation이 있다고 가정해보겠습니다.
Difference 자체는:
2와 20
즉 10배 차이입니다.
하지만 제곱하면:
4
와
400
으로 100배 차이가 됩니다.
따라서 Variance는 Extreme Observation의 영향을 강하게 받을 수 있습니다.
그렇다면 Outlier가 있으면 Standard Deviation을 쓰면 안 될까?
무조건 그렇다는 의미는 아닙니다.
먼저 Outlier의 원인을 확인해야 합니다.
실제 Data Error라면
Source 확인 필요
실제 Observation이라면
Distribution의 일부일 수 있음
이후 분석 목적에 따라:
- Mean + SD
- Median + IQR
- Transformation
- Robust Method
등을 고려할 수 있습니다.
Extreme Value를 발견했다는 이유만으로 Statistic을 바꾸는 것보다 먼저 그 값이 왜 존재하는지 확인하는 것이 중요합니다.
Range와 Variance는 어떻게 다를까?
Range는:
Maximum – Minimum
입니다.
전체 Data 가운데 두 값만 사용합니다.
반면 Variance는 모든 Observation이 Mean에서 얼마나 떨어져 있는지를 이용합니다.
따라서 같은 Range를 가진 Dataset도 Variance는 다를 수 있습니다.
같은 Range인데 Variance가 다른 예
Dataset A
0
49
50
51
100
Dataset B
0
1
50
99
100
두 Dataset 모두:
Minimum = 0
Maximum = 100
따라서 Range = 100입니다.
하지만 Data가 내부에서 퍼져 있는 방식은 다릅니다.
Variance는 이러한 전체 Observation의 Spread 차이를 반영할 수 있습니다.
Standard Deviation과 IQR은 어떻게 다를까?
Standard Deviation은 Mean을 기준으로 전체 Observation의 Spread를 반영합니다.
반면 Interquartile Range는:
Q3 – Q1
로 중앙 50% Data의 Spread를 나타냅니다.
즉:
Standard Deviation
모든 Data 사용
↓
Extreme Value에 민감
IQR
Middle 50% 중심
↓
Extreme Value에 상대적으로 덜 민감
입니다.
이 주제는 다음 글인 Range와 Interquartile Range의 차이에서 더 자세히 다룹니다.
Standard Deviation은 평균적인 거리일까?
직관적으로는 Mean 주변에서 Data가 얼마나 퍼져 있는지를 나타낸다고 이해할 수 있습니다.
하지만 정확하게 말하면 Absolute Distance의 단순 평균은 아닙니다.
다음 과정을 사용합니다.
Deviation
↓
Square
↓
Average-like calculation
↓
Square Root
따라서 “Mean에서 평균적으로 정확히 SD만큼 떨어져 있다”라고 지나치게 단순하게 표현하는 것은 피하는 것이 좋습니다.
Normal Distribution에서 Standard Deviation은 어떻게 해석할까?
Standard Deviation은 Normal Distribution에서 특히 직관적인 의미를 가집니다.
첨부 교재에서는 Population이 Normal Distribution을 따른다면 대략 다음과 같은 관계를 제시합니다.
- 약 68%가 Mean ± 1 SD 안에 존재
- 약 95%가 Mean ± 2 SD 안에 존재
- 약 99.7%가 Mean ± 3 SD 안에 존재
이를 흔히 68-95-99.7 Rule이라고 부릅니다.
예를 들어 Mean 100, SD 10이면?
Normal Distribution을 가정하면:
Mean ± 1 SD
90 ~ 110
↓
약 68%
Mean ± 2 SD
80 ~ 120
↓
약 95%
Mean ± 3 SD
70 ~ 130
↓
약 99.7%
정도의 Observation이 포함될 것으로 생각할 수 있습니다.
이 규칙을 모든 Data에 적용해도 될까?
아닙니다.
68-95-99.7 Rule은 Normal Distribution이라는 조건과 연결되어 있습니다.
Data가 매우 Skewed되어 있거나 다른 Distribution을 가진다면:
Mean ± 2 SD 안에 정확히 약 95%
가 존재한다고 단정하면 안 됩니다.
따라서 Standard Deviation을 해석할 때 Distribution Shape를 먼저 확인해야 합니다.
Normal Distribution에서 Mean과 SD가 중요한 이유
첨부 교재에서는 Normal Distribution이 Mean과 Standard Deviation으로 Characterize될 수 있다고 설명합니다.
Mean은 Distribution의 Center를 결정하고 Standard Deviation은 Distribution의 Width 또는 Variability를 결정합니다.
즉:
Mean
↓
Center 이동
Standard Deviation
↓
Distribution 폭 조절
입니다.
Standard Deviation이 커지면 Normal Curve는 어떻게 달라질까?
Mean이 동일하다고 가정해보겠습니다.
SD가 작음
↓
Data가 Mean 근처에 집중
↓
Narrow Distribution
SD가 큼
↓
Data가 넓게 퍼짐
↓
Wide Distribution
입니다.
첨부 교재에서도 Larger Standard Deviation은 Wider Normal Distribution을 의미한다고 설명합니다.
Mean이 달라지고 SD가 같다면?
Distribution의 Spread는 비슷하지만 Center가 달라집니다.
예를 들어:
Group A
Mean = 50
SD = 10
Group B
Mean = 100
SD = 10
두 Group은 비슷한 Spread를 가지지만 전체 Distribution 위치가 다릅니다.
즉 Mean과 SD는 Distribution의 서로 다른 특성을 독립적으로 설명합니다.
Variance가 통계모형에서 중요한 이유
Variance는 단순 Descriptive Statistic을 넘어 많은 Statistical Model의 핵심 요소입니다.
예를 들어:
- t-Test
- ANOVA
- Regression
- Confidence Interval
에서는 Data Variability가 중요한 역할을 합니다.
같은 Mean Difference라도 Variability가 큰지 작은지에 따라 Statistical Evidence가 달라질 수 있습니다.
평균 차이는 같은데 Variance가 다르면 어떻게 될까?
두 연구를 생각해보겠습니다.
Study A
Group 1 Mean = 100
Group 2 Mean = 110
두 Group SD = 2
Study B
Group 1 Mean = 100
Group 2 Mean = 110
두 Group SD = 50
Mean Difference는 둘 다 10입니다.
하지만 Study A에서는 Group Distribution이 상대적으로 잘 분리될 수 있고 Study B에서는 상당히 겹칠 수 있습니다.
즉 Difference의 크기만 아니라 Variability와 비교해야 합니다.
t-Test에서 Standard Deviation이 중요한 이유
t-Test에서는 Group Mean Difference를 Sampling Variability와 비교합니다.
Standard Deviation이 크면 Standard Error가 커질 수 있고 같은 Mean Difference라도 Test Statistic이 작아질 수 있습니다.
따라서:
Mean Difference
만으로 Statistical Significance를 결정할 수 없습니다.
Variability
와
Sample Size
를 함께 고려해야 합니다.
ANOVA에서 Variance가 왜 핵심일까?
ANOVA라는 이름 자체가 Analysis of Variance입니다.
여러 Group Mean을 비교할 때 단순히 Mean 숫자만 비교하는 것이 아니라:
Between-Group Variation
과
Within-Group Variation
을 비교합니다.
이 관계에서 F Statistic이 만들어집니다.
즉 Variance 개념을 이해하지 않으면 ANOVA의 원리를 이해하기 어렵습니다.
Within-Group Variation이란 무엇인가?
같은 Group 안의 Observation들이 Group Mean 주변에서 얼마나 퍼져 있는지를 의미합니다.
예를 들어 같은 Treatment를 받은 Patient라도 Outcome이 모두 동일하지 않습니다.
개인별 Variation이 존재합니다.
이 Variation이 크면 Group Mean Difference를 구분하기 어려울 수 있습니다.
Between-Group Variation은 무엇인가?
각 Group Mean들이 Overall Mean과 얼마나 떨어져 있는지를 나타내는 Variation과 연결됩니다.
ANOVA에서는 기본적으로:
Group 사이 Variation
↓
Treatment Effect Signal 가능
과
Group 내부 Variation
↓
Noise / Individual Variation
을 비교합니다.
이후 F Statistic 글에서 자세히 다루게 됩니다.
Regression에서도 Variance가 중요한가?
매우 중요합니다.
Regression에서는 Regression Line 주변에 실제 Observation이 얼마나 퍼져 있는지 Residual을 통해 평가합니다.
Response가 Model Prediction에서 크게 벗어나는 Observation이 많다면 Residual Variability가 커집니다.
즉 Regression에서도 Variance는 Model Accuracy와 Uncertainty를 이해하는 핵심 요소입니다.
Residual Standard Deviation은 무엇을 보여줄까?
Regression에서 Residual은:
Observed Response
Predicted Response
입니다.
Residual이 작다면 Prediction과 실제 값이 가깝습니다.
Residual이 크게 퍼져 있다면 Model이 설명하지 못한 Variation이 많습니다.
따라서 Residual Spread는 Model Evaluation에서 중요합니다.
Variance와 Error는 같은 것일까?
아닙니다.
Variance는 Data의 Variability를 수치적으로 나타냅니다.
Variation 자체가 Error라는 의미는 아닙니다.
예를 들어 사람들의 Height가 서로 다른 것은 자연스러운 Biological Variation입니다.
즉:
Variation
≠
Mistake
입니다.
Data Entry Error는 Variation의 한 원인이 될 수 있지만 모든 Variability가 잘못된 Data를 의미하지는 않습니다.
좋은 Data는 Standard Deviation이 작아야 할까?
그렇지 않습니다.
Standard Deviation 크기는 Population과 Variable의 실제 특성에 따라 달라집니다.
예를 들어 사람의 Income은 자연스럽게 큰 Variability를 가질 수 있습니다.
그렇다고 Data Quality가 나쁜 것은 아닙니다.
반대로 Standard Deviation이 매우 작아도 Measurement Device가 값을 지나치게 반올림해서 Variation을 잃은 것일 수도 있습니다.
따라서 SD의 좋고 나쁨을 절대적인 기준으로 판단하면 안 됩니다.
서로 다른 Unit의 Standard Deviation을 직접 비교해도 될까?
주의해야 합니다.
예를 들어:
Height SD = 8 cm
Weight SD = 12 kg
에서 숫자 12가 8보다 크다고 해서 Weight가 Height보다 “더 변동성이 크다”고 단순 비교하기 어렵습니다.
Unit과 Mean Scale 자체가 다르기 때문입니다.
이런 경우 상대적 Variability를 비교하기 위해 Coefficient of Variation을 사용할 수 있습니다.
Coefficient of Variation이란 무엇인가?
첨부 교재에서는 Coefficient of Variation, 즉 C.V.를 Standard Deviation을 Mean의 Percentage로 표현한 값으로 설명합니다.
개념적으로:
Standard Deviation
÷
Mean
×
100
↓
Coefficient of Variation
입니다.
이를 통해 Mean 수준이 다른 Data의 상대적인 Variation을 비교할 수 있습니다.
예를 들어 CV를 비교해보자
Dataset A
Mean = 100
SD = 10
↓
CV = 10%
Dataset B
Mean = 20
SD = 10
↓
CV = 50%
두 Dataset의 Standard Deviation은 모두 10입니다.
하지만 Mean에 비해 얼마나 큰 Variation인지 보면 Dataset B가 훨씬 큽니다.
CV는 모든 Variable에서 사용할 수 있을까?
주의해야 합니다.
Coefficient of Variation은 Mean에 대한 Ratio가 의미 있어야 하므로 일반적으로 의미 있는 Zero를 가진 Ratio Scale에서 더 자연스럽게 사용할 수 있습니다.
Interval Scale에서는 Zero Point가 임의적일 수 있기 때문에 CV Interpretation이 적절하지 않을 수 있습니다.
따라서 Formula가 계산된다는 이유만으로 모든 Continuous Variable에 적용하면 안 됩니다.
Mean이 0에 가까우면 CV는 어떻게 될까?
Mean이 매우 작거나 0에 가까우면 Standard Deviation을 Mean으로 나눈 CV가 매우 커지거나 불안정해질 수 있습니다.
따라서 CV를 사용할 때는 Measurement Scale뿐 아니라 Mean의 위치도 확인해야 합니다.
Standard Deviation의 단위가 중요한 이유
Mean과 SD가 동일한 Unit이라는 사실은 실제 결과 해석에 매우 중요합니다.
예를 들어:
Mean Change = -5 points
SD = 2 points
라면 Change 값들이 Mean -5 points 주변에서 어느 정도 퍼져 있는지 같은 Scale에서 이해할 수 있습니다.
반면 Variance = 4 points²는 수학적으로는 정확하지만 실제 Interpretation은 덜 직관적입니다.
Variance는 왜 굳이 사용할까?
Standard Deviation이 더 직관적인데도 Variance가 필요한 이유는 Mathematical Property 때문입니다.
통계모형에서는 Squared Deviation을 이용하는 것이 계산과 이론 전개에 유용합니다.
예를 들어 ANOVA는 여러 Variance Component를 비교하며 Regression의 Least Squares 역시 Squared Error와 연결됩니다.
즉:
Variance
↓
Statistical Theory / Modeling에서 핵심
Standard Deviation
↓
Human Interpretation에 더 직관적
이라고 이해할 수 있습니다.
Sum of Squares와 Variance는 어떻게 연결될까?
Mean과 각 Observation의 Difference를 제곱해 모두 합친 값을 Sum of Squares와 연결해서 생각할 수 있습니다.
Sample Variance는 이 Sum of Squares를 Degrees of Freedom으로 나눈 구조입니다.
개념적으로:
Deviation
↓
Square
↓
Sum
↓
Sum of Squares
↓
Degrees of Freedom으로 조정
↓
Variance
입니다.
이 구조는 이후 ANOVA에서 매우 중요해집니다.
왜 ANOVA 전에 Variance를 이해해야 할까?
ANOVA에서 F Statistic은 본질적으로 Variance의 Ratio와 연결됩니다.
즉:
Between-Group Variability
÷
Within-Group Variability
를 비교합니다.
Variance 개념을 모르고 ANOVA를 배우면 F Statistic을 단순 Formula로 외우게 됩니다.
반대로 Variance를 이해하면 ANOVA가 왜 “Analysis of Variance”라는 이름을 가지는지도 자연스럽게 이해할 수 있습니다.
Standard Deviation과 Standard Error는 같은 것일까?
아닙니다.
매우 자주 혼동되는 개념입니다.
Standard Deviation
Individual Observation의 Variability
Standard Error
Sample Statistic의 Sampling Variability
입니다.
예를 들어 Sample Mean의 Standard Error는 Sample Mean이 반복 Sampling에서 얼마나 달라질지를 나타냅니다.
첨부 교재에서도 Standard Deviation은 Data 자체의 Variability를 나타내고 Standard Error는 Sample Mean들의 Variation과 연결된다는 설명이 이어집니다.
Sample Size가 커지면 SD도 작아질까?
반드시 그렇지 않습니다.
Standard Deviation은 Population 또는 Sample Data 자체의 Spread를 나타냅니다.
Sample Size를 늘렸다고 실제 Population Variability가 없어지는 것은 아닙니다.
예를 들어 성인의 Height SD가 약 7cm인 Population에서:
n = 100
과
n = 10,000
Sample을 뽑더라도 Sample SD는 비슷한 수준을 추정할 수 있습니다.
Sample Size가 커지면 무엇이 작아질까?
일반적으로 Sample Mean의 Standard Error는 작아지는 경향이 있습니다.
개념적으로:
Standard Error
≈
SD / √n
이므로 n이 증가하면 SE는 감소합니다.
따라서:
SD
↓
Individual Data의 Spread
SE
↓
Mean Estimate의 Precision
을 구분해야 합니다.
SD가 크면 Sample Mean이 무조건 부정확할까?
Sample Size에 따라 달라집니다.
SD가 크더라도 n이 매우 크다면 Mean의 Standard Error는 충분히 작아질 수 있습니다.
반대로 SD가 상대적으로 작아도 Sample Size가 매우 작다면 Mean Estimate의 Uncertainty가 클 수 있습니다.
따라서 Inferential Statistics에서는:
SD
n
↓
SE
라는 관계가 중요합니다.
Variance는 Sample Size가 커질수록 0으로 가야 할까?
아닙니다.
이는 Standard Error와 Variance를 혼동한 것입니다.
Population 자체에 Variation이 존재한다면 Sample Size가 커져도 Sample Variance는 Population Variance를 더 안정적으로 추정할 뿐 0으로 줄어드는 것이 아닙니다.
즉 큰 Sample은 Variation을 없애는 것이 아니라 Variation을 더 정확하게 측정하는 것에 가깝습니다.
동일한 SD가 서로 다른 Distribution을 의미할 수도 있을까?
가능합니다.
Mean과 Standard Deviation이 같아도 Distribution Shape는 다를 수 있습니다.
예를 들어 하나는 Bell-Shaped이고 다른 하나는 Bimodal일 수도 있습니다.
따라서 Mean과 SD만으로 Data Distribution 전체를 완전히 설명할 수 없습니다.
Mean과 Standard Deviation은 강력한 Summary이지만 Distribution을 대체하지는 못합니다.
Normal Distribution에서는 Mean과 SD만으로 충분한 이유
첨부 교재에서는 Normal Distribution은 Mean과 Standard Deviation으로 완전히 Characterize된다고 설명합니다.
Normal Distribution에서는:
- Mean이 Center를 결정하고
- SD가 Width를 결정하며
- Shape는 Bell-Shaped로 정해져 있기 때문입니다.
하지만 실제 Data가 Normal이 아니라면 Mean과 SD만으로 전체 Shape를 알 수 없습니다.
그래서 Histogram을 함께 봐야 한다
Histogram을 보면:
- Symmetry
- Skewness
- Multiple Peaks
- Extreme Values
를 확인할 수 있습니다.
예를 들어 Mean = 50, SD = 10이라는 정보만 가지고는 Distribution이:
정규형인지
Right-Skewed인지
두 Group이 섞였는지
알 수 없습니다.
따라서 Descriptive Analysis에서는 Numeric Statistic과 Graph를 함께 확인해야 합니다.
Box Plot도 Variability를 보여줄까?
그렇습니다.
Box Plot은 주로 Median, Quartile, IQR 등을 시각화하여 Distribution의 Spread를 보여줍니다.
특히 Outlier 가능성을 확인하고 여러 Group의 Variability를 비교하기에 유용합니다.
즉:
Mean + SD
와
Median + IQR
은 Distribution 특성에 따라 서로 다른 Summary Pair로 사용할 수 있습니다.
Variance가 Group마다 크게 다르면 어떤 문제가 생길까?
ANOVA나 t-Test와 같은 일부 Statistical Method에서는 Group Variance 구조가 중요한 Assumption이 될 수 있습니다.
예를 들어:
Group A SD = 2
Group B SD = 40
이라면 두 Group의 Variability가 크게 다릅니다.
이 경우 단순 Equal Variance Assumption이 적절한지 확인해야 할 수 있습니다.
즉 Descriptive Statistics에서 SD를 확인하는 것은 Model Assumption 검토의 시작이기도 합니다.
Regression에서는 Variance가 일정해야 할까?
일반적인 Linear Regression에서는 Predictor 수준에 따라 Residual Variance가 일정한지 확인하는 것이 중요한 Diagnostic 중 하나입니다.
이를 Homoscedasticity와 연결할 수 있습니다.
반대로 Predictor 값에 따라 Residual Spread가 커지거나 작아진다면 Heteroscedasticity를 고려할 수 있습니다.
이 주제는 이후 Residual Analysis에서 자세히 다룹니다.
Variability가 큰 것이 반드시 나쁜 Model을 의미할까?
아닙니다.
Response 자체가 본질적으로 매우 다양한 Population일 수 있습니다.
중요한 것은 Model이 해당 Variability를 얼마나 설명하고 남은 Residual Variation이 어떤 구조를 보이는지입니다.
즉 Variation 자체가 잘못된 것이 아니라 Variation의 원인을 어떻게 설명할 것인가가 Statistical Modeling의 중요한 목적입니다.
Between-Subject Variation과 Within-Subject Variation은 다를까?
Repeated Measurement Data에서는 한 사람과 다른 사람 사이의 Variation과 같은 사람 안에서 시간에 따라 발생하는 Variation을 구분할 수 있습니다.
이 경우 단순 하나의 Standard Deviation만으로 모든 구조를 설명하기 어려울 수 있습니다.
즉 Data Structure가 복잡해지면 Variance도 여러 Component로 나누어 생각할 수 있습니다.
Measurement Error도 Variance에 포함될 수 있을까?
관찰된 Variability에는 여러 원인이 섞일 수 있습니다.
예를 들어:
Observed Variation
↓
True Biological Variation
Measurement Error
Other Noise
가 포함될 수 있습니다.
따라서 큰 SD를 발견했을 때 실제 Population Variation인지 Measurement Quality 문제인지 맥락을 확인해야 합니다.
Data Entry Error가 SD에 미치는 영향
예를 들어:
70
72
68
74
71
이라는 Weight Data에:
710
이 잘못 입력되면 Mean과 SD가 모두 크게 증가합니다.
특히 Variance는 Squared Difference를 사용하기 때문에 이러한 Error에 매우 민감할 수 있습니다.
따라서 SD가 예상보다 비정상적으로 크면:
- Maximum
- Minimum
- Raw Data
- Unit
- Coding
을 확인하는 것이 좋습니다.
Unit 혼합도 Variance를 왜곡할 수 있다
일부 Weight가 kg이고 일부가 lb라면 Distribution이 비정상적으로 넓어질 수 있습니다.
SAS는 숫자 자체만 보고 모두 같은 Unit이라고 가정해 계산할 수 있습니다.
따라서 Standard Deviation이 크다는 것을 Population Variability라고 해석하기 전에 Data Standardization 여부를 확인해야 합니다.
Change Score의 SD는 무엇을 의미할까?
Change from Baseline이:
Follow-up – Baseline
으로 정의되어 있다면 Mean Change는 평균적인 변화 방향을 나타냅니다.
Standard Deviation of Change는 Individual들의 변화량이 Mean Change 주변에서 얼마나 다양한지를 보여줍니다.
예를 들어:
Mean Change = -5
SD = 1
이면 대부분 비슷한 방향의 변화가 있을 수 있습니다.
반면:
Mean Change = -5
SD = 20
이면 Individual Response Variation이 매우 클 수 있습니다.
평균 Treatment Effect만 보면 놓칠 수 있는 것
Treatment A와 B의 Mean Difference가 5라고 가정해보겠습니다.
하지만 개별 Response Variability가 매우 큰 경우 어떤 Patient에서는 큰 Improvement가 있고 어떤 Patient에서는 Worsening이 있을 수 있습니다.
Mean Difference는 Group 수준의 평균 효과를 보여주지만 Individual Heterogeneity 전체를 보여주지는 않습니다.
따라서 SD와 Distribution을 함께 확인해야 합니다.
SD가 0이면 Statistical Test가 가능할까?
모든 Observation이 동일해 SD가 0이라면 Variability가 전혀 없습니다.
이 경우 Variance를 이용하는 일부 Statistical Calculation에서는 특별한 문제가 발생하거나 일반적인 Formula를 적용하기 어려울 수 있습니다.
즉 Variability가 전혀 없는 Data는 일반적인 Statistical Inference에서 특수한 상황입니다.
Sample SD와 Population SD를 혼동하면 안 되는 이유
SAS에서 Sample Data를 분석해 얻은 Standard Deviation은 일반적으로 Sample Statistic입니다.
이는 Population Standard Deviation σ 자체가 아니라 이를 추정하는 값입니다.
즉:
Population SD
σ
↓
Unknown
Sample SD
s
↓
Observed
↓
σ Estimate
입니다.
Standard Deviation에 Confidence Interval도 있을까?
가능합니다.
Sample SD 역시 Statistic이므로 Sampling Variability를 가집니다.
따라서 Population Variance나 Standard Deviation에 대한 Confidence Interval을 구성할 수도 있습니다.
이 글에서는 기본 Descriptive Interpretation에 초점을 두지만, Variance 자체도 Inferential Target이 될 수 있다는 점이 중요합니다.
Variance는 왜 제곱값이라 크게 보일까?
예를 들어 SD가 10이면 Variance는:
100
입니다.
SD가 20이면 Variance는:
400
입니다.
즉 SD가 2배가 되면 Variance는 4배가 됩니다.
따라서 Variance 숫자 자체를 SD처럼 직관적으로 비교하면 오해할 수 있습니다.
SD가 두 배면 Data가 정확히 두 배 넓다는 뜻일까?
같은 종류의 Distribution과 Scale을 비교할 때 Spread가 더 크다고 볼 수 있지만 “모든 Observation이 정확히 두 배 멀어진다”는 의미는 아닙니다.
Standard Deviation은 전체 Distribution의 요약 Statistic입니다.
따라서 실제 Data Pattern을 함께 확인해야 합니다.
Standard Deviation을 서로 다른 Group에서 비교할 때 확인할 것
다음 조건을 확인하는 것이 좋습니다.
- 동일한 Variable인가?
- 동일한 Unit인가?
- 동일한 Scale인가?
- Extreme Value가 있는가?
- Sample Size가 충분한가?
- Group Distribution Shape가 비슷한가?
단순 숫자 크기만 비교하는 것은 제한적일 수 있습니다.
SAS Enterprise Guide에서는 Variance와 SD를 확인할 수 있을까?
가능합니다.
Summary Statistics Task를 이용해 Mean과 함께 Standard Deviation, Variance 등 여러 Descriptive Statistic을 생성할 수 있습니다.
중요한 점은 출력값을 단순히 복사하는 것이 아니라 다음과 같은 방식으로 해석하는 것입니다.
Mean
↓
Center
Variance / SD
↓
Spread
Min / Max
↓
Range와 Extreme Value
Quartile
↓
Central Distribution
이렇게 여러 Statistic을 함께 보아야 합니다.
SAS에서 SD가 예상보다 크면 무엇을 먼저 할까?
다음 순서가 유용합니다.
1. N 확인
↓
2. Missing 확인
↓
3. Minimum / Maximum 확인
↓
4. Histogram 확인
↓
5. Box Plot 확인
↓
6. Unit / Coding 확인
↓
7. Extreme Observation 원자료 확인
바로 Statistical Model을 수정하기보다 Data 자체를 먼저 확인하는 것이 좋습니다.
Variance와 Standard Deviation의 전체 관계
핵심 구조를 정리하면 다음과 같습니다.
Data
↓
Mean 계산
↓
각 Observation과 Mean의 Difference
↓
Difference²
↓
합산 및 Degrees of Freedom 반영
↓
Variance
↓
Square Root
↓
Standard Deviation
즉:
Variance
=
Squared Scale의 Dispersion Measure
Standard Deviation
=
Original Scale의 Dispersion Measure
입니다.
Mean과 SD를 함께 이해하는 구조
Data Distribution을 간단하게 요약하면:
Mean
↓
Center
그리고
Standard Deviation
↓
Spread
입니다.
예를 들어 Normal Distribution에서는 이 두 Parameter가 Distribution을 Characterize하며 Mean이 Center를, Standard Deviation이 Variability를 결정합니다.
하지만 Distribution이 Skewed하거나 Extreme Outlier가 존재하면 Median과 IQR 같은 다른 Summary를 함께 고려해야 합니다.
흔한 오해 정리
“Mean이 같으면 두 Dataset은 비슷하다”
아닙니다.
Variance와 Standard Deviation이 크게 다를 수 있습니다.
“Variance와 Standard Deviation은 완전히 다른 정보를 측정한다”
아닙니다.
둘 모두 Dispersion을 측정하며 Standard Deviation은 Variance의 Square Root입니다.
“Variance의 Unit은 원래 Data와 같다”
아닙니다.
Variance는 원래 Unit의 제곱입니다.
“Standard Deviation은 Mean에서 평균적으로 떨어진 정확한 거리다”
지나치게 단순한 표현입니다.
Squared Deviation과 Square Root를 이용해 계산되는 Dispersion Measure입니다.
“SD가 크면 Data가 잘못되었다”
아닙니다.
실제 Population Variability가 클 수 있습니다.
“SD가 작으면 좋은 Data다”
반드시 그렇지 않습니다.
Data 특성과 Measurement Context를 확인해야 합니다.
“Sample Size가 커지면 SD는 자동으로 0에 가까워진다”
아닙니다.
Sample Size 증가로 주로 감소하는 것은 Mean의 Standard Error이며 Sample SD는 Population SD를 더 안정적으로 추정합니다.
“Standard Deviation과 Standard Error는 같은 값이다”
아닙니다.
SD는 Observation의 Variability, SE는 Statistic의 Sampling Variability를 나타냅니다.
“Mean ± 2 SD에는 항상 약 95%가 들어간다”
아닙니다.
이 해석은 Normal Distribution 조건과 연결됩니다.
“Outlier가 있으면 SD를 사용하면 안 된다”
자동으로 그렇게 결정할 수 없습니다.
Outlier의 원인과 Distribution을 먼저 확인해야 합니다.
왜 Variance와 Standard Deviation을 이해해야 할까?
이후 Statistical Analysis의 많은 개념이 Variability를 기반으로 합니다.
Confidence Interval
↓
Standard Error를 통해 Uncertainty 평가
t-Test
↓
Mean Difference를 Variability와 비교
ANOVA
↓
Between / Within Variance 비교
Regression
↓
Residual Variability 평가
Regression Diagnostics
↓
Residual Spread와 Pattern 확인
즉 Mean Difference만으로 Statistical Evidence를 판단하지 않습니다.
얼마나 큰 Variation 속에서 그 Difference가 나타났는지를 함께 봐야 합니다.
핵심 정리
Variance와 Standard Deviation은 Data가 Mean 주변에서 얼마나 퍼져 있는지를 측정하는 Dispersion Statistic입니다.
첨부 교재에서는 Variance를 Mean 주변 Data의 Dispersion Measure로 정의하고, Standard Deviation을 Variance의 Square Root이면서 원래 Data와 동일한 Measurement Unit으로 표현되는 Spread Measure라고 설명합니다.
두 Statistic의 관계는 다음과 같습니다.
Mean
↓
각 Observation과의 Difference
↓
Difference²
↓
Variance
↓
Square Root
↓
Standard Deviation
Variance는 Statistical Theory와 Model Calculation에서 중요하지만 Unit이 제곱되므로 실제 Interpretation에서는 Standard Deviation이 더 직관적입니다.
또한 Mean이 동일하더라도 Standard Deviation이 다르면 Data Distribution은 크게 다를 수 있습니다.
따라서:
Mean
↓
Data가 어디에 위치하는가?
와
Standard Deviation
↓
Data가 얼마나 퍼져 있는가?
를 함께 확인해야 합니다.
Normal Distribution에서는 Mean과 Standard Deviation이 Distribution을 Characterize하며, 약 68%가 Mean ± 1 SD, 약 95%가 Mean ± 2 SD, 약 99.7%가 Mean ± 3 SD 범위에 위치하는 성질을 이용할 수 있습니다.
하지만 Skewed Distribution이나 Extreme Outlier가 존재하는 경우에는 Median과 Interquartile Range가 더 적절한 Summary가 될 수 있습니다. 첨부 교재 역시 이러한 상황에서 IQR 사용을 설명합니다.
평균은 Data의 중심만 알려줍니다. 실제 Data가 얼마나 일정한지, 얼마나 다양한지, Group 간 차이가 Noise에 비해 얼마나 큰지를 이해하려면 Variance와 Standard Deviation이 반드시 필요합니다.
함께 읽으면 좋은 글
- Descriptive Statistics의 목적: 본격적인 분석 전에 데이터를 진단해야 하는 이유
- Mean·Median·Mode의 차이: 데이터 분포에 따라 중심값을 선택하는 기준
- Range와 Interquartile Range의 차이: 이상치 영향을 줄여 산포를 측정하는 방법
- Distribution을 먼저 확인해야 하는 이유: 데이터의 위치·산포·형태를 점검하는 과정
- F Statistic의 원리: 집단 간 변동과 집단 내 변동을 비교하는 방식
참고한 자료
- SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
- Introduction to Statistics
- Descriptive Statistics
- The Spread of a Distribution: Dispersion
- Variance and Standard Deviation
- Normal Distributions




댓글 0
첫 댓글을 남겨보세요.