Parameter와 Statistic의 차이: 모집단 특성을 표본 통계량으로 추정하는 방식
통계분석에서는 Population과 Sample을 구분하는 것만큼 중요한 개념이 하나 더 있습니다.
바로 Parameter와 Statistic의 차이입니다.
Population에는 우리가 궁극적으로 알고 싶은 특성이 존재합니다.
예를 들어:
- 모집단 평균
- 모집단 분산
- 모집단 표준편차
- 모집단 비율
- 모집단 Regression Coefficient
같은 값입니다.
하지만 Population 전체를 직접 측정할 수 없는 경우가 많기 때문에 실제로는 Sample을 수집하고 Sample에서 계산한 Statistic을 이용해 Population Parameter를 추정합니다.
Parameter는 Population의 특성을 나타내는 값이고, Statistic은 Sample에서 계산한 값입니다.
이 차이를 이해하면 이후에 등장하는 Confidence Interval, Hypothesis Testing, Regression Parameter Estimation 같은 개념이 훨씬 명확해집니다.
Parameter란 무엇인가?
Parameter는 Population 전체의 특성을 나타내는 값입니다.
예를 들어 어떤 Population의 평균 키가 실제로 170.4cm라고 가정해보겠습니다.
이 값은 Population 전체의 Mean입니다.
즉:
Population
↓
모든 대상
↓
Population Mean
170.4 cm
입니다.
이 Population Mean은 Parameter입니다.
다른 예로 Population의 Standard Deviation이나 Variance 역시 Parameter입니다.
Statistic이란 무엇인가?
Statistic은 Sample에서 계산한 값입니다.
예를 들어 Population에서 100명을 Random Sampling한 뒤 평균 키를 계산했더니:
171.2 cm
가 나왔다고 가정해보겠습니다.
이 값은 Population Mean이 아니라 Sample Mean입니다.
즉 Statistic입니다.
전체 구조는:
Population
↓
Random Sample
↓
Sample
↓
Sample Mean 계산
↓
Statistic
입니다.
Parameter와 Statistic의 핵심 차이
가장 간단하게 정리하면 다음과 같습니다.
Parameter
Population의 값
Statistic
Sample의 값
입니다.
예를 들어:
Population Mean
↓
Parameter
Sample Mean
↓
Statistic
입니다.
첨부 교재에서도 Population Parameter와 Sample Statistic을 서로 대응시키며, Sample Statistics를 이용해 Population Parameters를 Approximate한다고 설명합니다.
왜 Parameter를 직접 계산하지 못할까?
Population 전체의 Data를 가지고 있다면 Parameter를 직접 계산할 수 있습니다.
하지만 실제 연구에서는 Population이 매우 크거나 모든 대상을 측정하기 어려운 경우가 많습니다.
예를 들어 전국 성인의 평균 혈압을 알고 싶다고 가정해보겠습니다.
모든 성인을 조사하는 것은 현실적으로 어렵습니다.
따라서:
Population
전국 성인 전체
↓
일부 Sample 선택
↓
Blood Pressure 측정
↓
Sample Mean 계산
↓
Population Mean 추정
이라는 방식을 사용합니다.
Statistic이 필요한 이유는 대부분의 Population Parameter가 직접 관찰되지 않는 Unknown Value이기 때문입니다.
Population Mean과 Sample Mean은 어떻게 표현할까?
통계학에서는 Population과 Sample을 구분하기 위해 다른 Symbol을 사용하는 경우가 많습니다.
Population Mean
μ
Sample Mean
x̄
입니다.
즉:
μ
↓
Population Parameter
x̄
↓
Sample Statistic
입니다.
이 Symbol 구분은 단순 표기법이 아니라 어떤 값이 Population을 의미하고 어떤 값이 Sample에서 계산된 것인지를 알려줍니다.
Population Variance와 Sample Variance는 어떻게 다를까?
Variance에서도 같은 구조가 있습니다.
Population Variance
σ²
Sample Variance
s²
입니다.
즉 Sample에서 계산한 s²를 이용해 Population의 σ²를 추정합니다.
전체적으로:
Population
↓
σ²
Unknown
↓
Sample
↓
s²
Observed
↓
σ² Estimate
라는 구조입니다.
Standard Deviation도 같은 구조일까?
그렇습니다.
Population Standard Deviation
σ
Sample Standard Deviation
s
입니다.
따라서:
σ
↓
Parameter
s
↓
Statistic
입니다.
첨부 교재에서도 Population Mean, Variance, Standard Deviation과 이에 대응하는 Sample Mean, Variance, Standard Deviation을 구분하여 설명합니다.
왜 Population Parameter는 고정되어 있다고 할까?
Frequentist Statistics의 기본 관점에서는 Population이 정해져 있다면 Parameter는 하나의 고정된 값으로 생각합니다.
예를 들어 Population Mean이 실제로:
1200
이라고 가정해보겠습니다.
이 값은 Sample을 어떻게 뽑든 변하지 않습니다.
하지만 우리가 그 값을 모르고 있을 뿐입니다.
즉:
Parameter
↓
Fixed
하지만
Unknown
입니다.
Statistic은 왜 Sample마다 달라질까?
Statistic은 Sample Data에서 계산하기 때문입니다.
예를 들어 동일한 Population에서 50명씩 여러 번 Random Sampling한다고 가정해보겠습니다.
Sample 1
↓
Mean = 1195
Sample 2
↓
Mean = 1211
Sample 3
↓
Mean = 1189
처럼 서로 다른 Sample Mean이 나올 수 있습니다.
즉 Statistic은 Sample에 따라 달라질 수 있습니다.
Parameter는 고정되어 있지만 Unknown이고, Statistic은 관찰할 수 있지만 Sample마다 변할 수 있습니다.
Sample Statistic이 Population Parameter와 정확히 같아야 할까?
아닙니다.
Sample Mean이 Population Mean과 정확히 같아지는 경우도 있을 수 있지만 일반적으로 어느 정도 차이가 발생합니다.
예를 들어:
Population Mean = 1200
인데 Sample Mean이:
1192
일 수 있습니다.
이 차이는 Sampling 과정에서 자연스럽게 발생할 수 있습니다.
따라서 Statistics는 Statistic과 Parameter가 완전히 같다고 가정하지 않습니다.
대신 그 차이를 Sampling Variability로 다룹니다.
Estimate란 무엇인가?
Estimate는 Sample Statistic을 이용해 Population Parameter를 추정한 값입니다.
예를 들어:
Sample Mean = 1192
라면 Population Mean의 Estimate로:
1192
를 사용할 수 있습니다.
즉:
Statistic
↓
Parameter를 추정하기 위해 사용
↓
Estimate
라고 생각할 수 있습니다.
다만 Sample Mean 자체는 관찰된 Statistic이고, 그것을 Population Mean의 추정값으로 사용할 때 Estimator / Estimate 개념과 연결됩니다.
Estimator와 Estimate는 같은 말일까?
엄밀하게는 구분할 수 있습니다.
Estimator
Parameter를 추정하기 위해 사용하는 규칙 또는 Statistic의 형태
예:
Sample Mean x̄
Estimate
실제 Sample을 적용해서 얻은 구체적인 값
예:
x̄ = 1192
입니다.
즉:
Estimator
↓
Sample Mean이라는 추정 방법
Estimate
↓
실제 계산 결과 1192
라고 이해할 수 있습니다.
Point Estimate란 무엇인가?
Point Estimate는 하나의 숫자로 Population Parameter를 추정하는 방식입니다.
예를 들어 Population Mean을 추정할 때:
Sample Mean = 1192
라면:
Point Estimate of μ = 1192
라고 할 수 있습니다.
전체 구조는:
Unknown μ
↓
Sample
↓
x̄ = 1192
↓
Point Estimate
입니다.
Point Estimate 하나만 보면 무엇이 부족할까?
Point Estimate는 간단하지만 불확실성을 보여주지 않습니다.
예를 들어 두 Study에서 모두:
Sample Mean = 100
이라고 가정해보겠습니다.
Study A
n = 10
Study B
n = 10,000
두 연구 모두 Mean은 100이지만 Population Mean에 대한 Precision은 같지 않을 수 있습니다.
따라서 Point Estimate와 함께 다음을 고려해야 합니다.
- Standard Error
- Confidence Interval
- Sample Size
Standard Error는 Statistic의 불확실성과 어떻게 연결될까?
Sample Mean은 Sample마다 달라질 수 있습니다.
Standard Error는 이러한 Statistic의 Sampling Variability를 나타냅니다.
예를 들어 Sample Mean의 Standard Error가 작다면 반복 Sampling에서 Mean이 비교적 좁은 범위에 모이는 경향을 의미합니다.
반대로 Standard Error가 크다면 Sample Mean의 변동성이 더 큽니다.
즉:
Statistic
↓
Sample마다 변함
↓
Sampling Distribution
↓
Standard Error
로 연결됩니다.
Standard Deviation과 Standard Error를 혼동하면 안 되는 이유
두 값은 비슷한 이름을 가지고 있지만 의미가 다릅니다.
Standard Deviation
Sample 안 Observation의 Spread
Standard Error
Statistic의 Sampling Variability
입니다.
예를 들어 사람들의 Height가 얼마나 다양한지를 보고 싶다면 Standard Deviation을 봅니다.
하지만 Sample Mean이 Population Mean을 얼마나 정밀하게 Estimate하는지 알고 싶다면 Standard Error가 중요합니다.
Statistic의 Sampling Distribution이란 무엇인가?
동일한 Population에서 같은 크기의 Sample을 여러 번 추출한다고 생각해보겠습니다.
각 Sample에서 Mean을 계산합니다.
Sample 1
x̄₁
Sample 2
x̄₂
Sample 3
x̄₃
…
이러한 Sample Means 전체의 Distribution을 Sampling Distribution of the Mean이라고 합니다.
Statistic은 하나의 Sample에서 계산되지만, Statistics에서는 Statistic이 반복 Sampling에서 어떻게 움직이는지 생각합니다.
왜 Sampling Distribution이 중요한가?
Population Parameter를 추론하려면 Statistic이 얼마나 안정적인지를 알아야 합니다.
Sampling Distribution을 통해 다음 개념이 만들어집니다.
- Standard Error
- Confidence Interval
- Hypothesis Test
- p-value
즉 Parameter와 Statistic의 차이를 이해하지 못하면 이후 Inferential Statistics 개념을 이해하기 어렵습니다.
Sample Size가 커지면 Statistic은 어떻게 될까?
다른 조건이 비슷하다면 Sample Size가 증가할수록 Sample Mean의 Standard Error는 작아지는 경향이 있습니다.
이는 Sample Mean이 Population Mean 주변에서 더 안정적으로 나타날 가능성이 높다는 뜻입니다.
개념적으로:
Small Sample
↓
Statistic Variation 큼
Large Sample
↓
Statistic Variation 작아지는 경향
입니다.
하지만 Sample Size가 커져도 Bias가 해결되는 것은 아닙니다.
Biased Statistic이란 무엇인가?
Estimator가 반복 Sampling에서 Population Parameter를 체계적으로 과대 또는 과소 추정하는 성질을 가진다면 Bias를 고려해야 합니다.
또 Estimator 자체가 적절하더라도 Sample Selection이 Bias되면 Estimate가 Population Parameter에서 체계적으로 벗어날 수 있습니다.
따라서 정확한 Parameter Estimation에는:
좋은 Sampling
적절한 Estimator
가 모두 필요합니다.
Sample Mean은 Population Mean의 좋은 Estimator일까?
일반적인 Random Sampling 조건에서 Sample Mean은 Population Mean을 추정하는 대표적인 Estimator입니다.
반복적으로 Random Sample을 뽑는다고 생각하면 Sample Mean이 Population Mean 주변에서 변동합니다.
이 때문에:
x̄
↓
μ를 추정
하는 구조가 통계학에서 매우 중요합니다.
Sample Variance에서 왜 n-1을 사용할까?
Sample Variance는 흔히 Population Variance를 추정하기 위해 분모에 n-1을 사용합니다.
이는 Sample Mean을 이용해 Population Mean을 대신 추정하면서 발생하는 자유도와 Bias Correction에 연결됩니다.
즉 Sample Statistic은 단순히 Population Formula에 Sample 값만 넣는 것이 아니라 Population Parameter를 잘 추정하도록 구성될 수 있습니다.
이 주제는 Variance를 다룰 때 더 자세히 연결할 수 있습니다.
Parameter는 평균과 분산에만 존재할까?
아닙니다.
Population의 여러 특성이 Parameter가 될 수 있습니다.
예를 들어:
- Population Mean
- Population Variance
- Population Standard Deviation
- Population Proportion
- Correlation
- Regression Intercept
- Regression Slope
- Logistic Regression Coefficient
등이 있습니다.
즉 Statistical Model에서 우리가 추정하는 대부분의 핵심 값은 Population Parameter와 연결됩니다.
Population Proportion은 어떻게 추정할까?
예를 들어 Population에서 특정 Product를 선호하는 사람의 비율을 알고 싶다고 가정해보겠습니다.
Population Proportion을:
p
라고 할 수 있습니다.
하지만 전체 Population을 조사하지 않고 Sample 500명을 조사했더니 300명이 Product를 선호했습니다.
Sample Proportion은:
300 / 500 = 0.60
입니다.
즉:
Sample Proportion = 0.60
을 이용해:
Population Proportion p
를 추정합니다.
Regression에도 Parameter와 Statistic이 있을까?
있습니다.
Population에서 X와 Y 사이의 관계를 다음처럼 표현한다고 가정해보겠습니다.
Population Regression
Y = β₀ + β₁X + Error
여기서:
β₀
β₁
은 Population Parameter입니다.
하지만 우리는 Population 전체를 관찰하지 않습니다.
Sample Data에서 Regression을 실행하면:
b₀
b₁
같은 Estimated Coefficient를 얻습니다.
즉:
Population Parameter
β₀, β₁
↓
Sample
↓
Estimated Coefficient
b₀, b₁
형태입니다.
Regression Slope의 Estimate는 무엇을 의미할까?
예를 들어 Sample Regression에서:
Slope = 2.5
가 나왔다고 가정해보겠습니다.
이 값은 Sample Data에서 추정한 Relationship입니다.
궁극적으로는 Population에서의 Slope Parameter를 추정하기 위해 사용됩니다.
따라서 SAS Regression Output에 나타난 Coefficient는 단순히 Sample 안에서만 의미 있는 숫자가 아니라 Unknown Population Parameter에 대한 Estimate로 해석할 수 있습니다.
Logistic Regression에서도 같은 원리가 적용될까?
그렇습니다.
Logistic Regression에서 나타나는 Regression Coefficient와 Odds Ratio도 Sample Data를 이용해 Population Relationship을 추정합니다.
예를 들어:
Treatment Coefficient
Age Coefficient
Gender Coefficient
는 실제 Sample에서 계산됩니다.
하지만 Statistical Inference의 관심은 Population에서 이러한 Predictor와 Response 사이의 관계가 어떤지를 평가하는 것입니다.
ANOVA에서도 Parameter를 추정할까?
그렇습니다.
ANOVA에서는 각 Population Group Mean을 생각할 수 있습니다.
예:
μ₁
μ₂
μ₃
이 값은 Population Parameters입니다.
Sample에서는 각 Group Mean:
x̄₁
x̄₂
x̄₃
를 계산합니다.
그리고 이 Sample Statistics를 이용해 Population Mean들이 동일한지 평가합니다.
즉:
Sample Group Means
↓
Population Group Means에 대한 Evidence
↓
ANOVA Test
가 됩니다.
Hypothesis Test는 Parameter를 대상으로 할까?
대부분의 Inferential Hypothesis Test는 Population Parameter에 대한 Hypothesis를 평가합니다.
예를 들어:
H₀: μ = 1200
이라는 Null Hypothesis가 있다고 가정해보겠습니다.
이 문장은:
Sample Mean이 1200인가?
를 묻는 것이 아닙니다.
Population Mean μ가 1200이라고 볼 수 있는지를 Sample Data로 평가하는 것입니다.
즉:
Population Parameter Hypothesis
↓
Sample Statistic
↓
Sampling Distribution
↓
Test Statistic / p-value
↓
Decision
입니다.
Sample Mean이 1190인데 왜 μ=1200을 바로 기각하지 않을까?
Sample Mean은 Sampling Variability 때문에 Population Mean과 다를 수 있기 때문입니다.
1190과 1200의 Difference가 10이라고 해도:
- Sample Size
- Standard Deviation
- Standard Error
에 따라 그 Difference가 큰지 작은지가 달라집니다.
즉 단순한 Numeric Difference보다 Sampling Uncertainty와 비교해야 합니다.
이것이 Hypothesis Testing의 핵심입니다.
Confidence Interval도 Parameter에 대한 추정일까?
그렇습니다.
Confidence Interval은 Sample Statistic 하나만 제시하는 대신 Population Parameter에 대한 Plausible Range를 제공합니다.
예를 들어:
Sample Mean = 1190
95% Confidence Interval:
1160 ~ 1220
이라고 가정해보겠습니다.
이때:
1190
은 Point Estimate이고,
1160 ~ 1220
은 Population Mean에 대한 Interval Estimate입니다.
Point Estimate와 Interval Estimate의 차이
Point Estimate
하나의 숫자
예:
μ ≈ 1190
Interval Estimate
범위
예:
1160 ~ 1220
입니다.
Point Estimate는 간단하지만 Precision을 보여주지 않습니다.
Interval Estimate는 불확실성을 함께 표현합니다.
Statistic을 Parameter와 동일하다고 생각하지 않고 Estimate로 이해해야 Confidence Interval의 필요성을 이해할 수 있습니다.
Statistic이 Parameter보다 클 수도 있을까?
물론입니다.
예를 들어 Population Mean이 실제로 100이라고 가정해보겠습니다.
Random Sample에서:
102
105
98
99
같은 Sample Mean이 나올 수 있습니다.
Statistic은 Parameter보다 크거나 작을 수 있습니다.
반복 Sampling에서는 Population Parameter 주변에서 Variation할 수 있습니다.
Statistic이 Parameter에서 멀리 떨어져 나오면 무조건 Sampling Error일까?
반드시 그렇지는 않습니다.
가능한 원인은 여러 가지입니다.
- 자연스러운 Sampling Variability
- Biased Sampling
- Data Error
- Measurement Error
- Small Sample
- Extreme Value
따라서 Statistic과 예상 Parameter의 차이를 발견하면 원인을 검토해야 합니다.
Parameter는 Sample마다 바뀌지 않을까?
Target Population 자체가 동일하다는 전제에서는 Parameter는 고정되어 있다고 봅니다.
하지만 Population Definition이 바뀌면 Parameter도 달라집니다.
예를 들어:
Population A
한국 성인 전체
와
Population B
서울의 65세 이상 성인
은 다른 Population입니다.
따라서 평균 Blood Pressure Parameter도 다를 수 있습니다.
즉 Parameter는 Population Definition과 연결되어 있습니다.
Population이 시간에 따라 변하면 Parameter도 변할 수 있을까?
가능합니다.
예를 들어:
2020년 Population의 평균 Income
과
2026년 Population의 평균 Income
은 다를 수 있습니다.
이 경우 우리는 동일한 Target Concept을 보더라도 서로 다른 시점의 Population을 정의하고 있는 것입니다.
따라서 Parameter를 해석할 때:
- Population
- Time
- Definition
을 함께 확인해야 합니다.
Sample Statistic에 Unit도 중요할까?
그렇습니다.
예를 들어 Sample Mean Height가:
170
이라고만 적혀 있으면 의미가 부족합니다.
170 cm인지 170 inches인지 알아야 합니다.
또 Regression Coefficient도 Predictor와 Response의 Unit에 따라 Interpretation이 달라집니다.
따라서 Parameter와 Statistic은 숫자뿐 아니라 Measurement Unit과 Definition을 함께 봐야 합니다.
Sample Statistic은 Data Quality의 영향을 받을까?
매우 크게 받습니다.
예를 들어 Sample Mean을 계산하는데 한 값이:
170
175
168
172
1700
으로 잘못 입력되어 있다고 가정해보겠습니다.
Sample Mean은 크게 왜곡됩니다.
그리고 왜곡된 Statistic을 Population Parameter Estimate로 사용하면 Inferential Result까지 영향을 받습니다.
따라서 첨부 교재에서도 Inferential Statistics 전에 Sample Data를 먼저 Explore하고 unusual value와 extreme value를 확인하도록 설명합니다.
Outlier가 Parameter Estimate에 영향을 줄 수 있을까?
가능합니다.
특히 Mean과 Regression Coefficient는 Extreme Observation의 영향을 받을 수 있습니다.
따라서 Statistic을 계산했다고 해서 바로 Population Parameter Estimate로 신뢰하는 것이 아니라:
- Distribution
- Outlier
- Data Error
를 먼저 검토해야 합니다.
Statistic은 Sample 전체의 정보를 완전히 보여줄까?
아닙니다.
예를 들어 두 Sample의 Mean이 모두 100이라고 가정해보겠습니다.
Sample A
99, 100, 101
Sample B
0, 100, 200
Mean은 둘 다 100입니다.
하지만 Distribution과 Variability는 완전히 다릅니다.
따라서 Mean 하나의 Statistic만으로 Sample 전체 구조를 설명할 수 없습니다.
이 때문에:
- Variance
- Standard Deviation
- Quartile
- Distribution Plot
등을 함께 확인해야 합니다.
Parameter 추정 전에 Descriptive Statistics가 필요한 이유
Population Parameter를 추정하기 전에 Sample Data의 특성을 이해해야 합니다.
전체 흐름은:
Sample
↓
Data Quality 확인
↓
Descriptive Statistics
↓
Distribution 확인
↓
Appropriate Statistic 선택
↓
Parameter Estimation
입니다.
예를 들어 매우 Skewed된 Data에서는 Mean보다 Median이 Sample의 Center를 더 잘 설명할 수 있습니다.
어떤 Parameter를 어떻게 추정할지도 Research Question에 따라 달라집니다.
Sample Median도 Statistic일까?
그렇습니다.
Sample에서 계산한 모든 대표적인 Summary Measure는 Statistic이 될 수 있습니다.
예:
- Sample Mean
- Sample Median
- Sample Variance
- Sample Standard Deviation
- Sample Proportion
- Sample Correlation
모두 Statistic입니다.
그리고 각각 대응하는 Population Characteristic을 추정하는 데 사용될 수 있습니다.
Correlation에도 Population Parameter가 있을까?
있습니다.
Population Correlation Coefficient를 일반적으로:
ρ
로 표현할 수 있습니다.
Sample Correlation Coefficient는:
r
로 표현할 수 있습니다.
즉:
Population Correlation
ρ
↓
Sample Data
↓
Sample Correlation
r
을 계산하여 Population Relationship을 추정합니다.
왜 Symbol을 다르게 쓰는 것이 중요할까?
통계 결과를 읽을 때 Symbol이 어떤 수준을 의미하는지 알려주기 때문입니다.
예를 들어:
μ
와
x̄
를 혼동하면:
Population Mean
과
Sample Mean
을 같은 것으로 생각할 수 있습니다.
마찬가지로:
σ
와
s
를 구분해야 합니다.
이 표기 차이는 Inferential Statistics의 구조를 보여주는 중요한 장치입니다.
Parameter와 Statistic의 기본 대응 관계
다음과 같이 정리할 수 있습니다.
| Population Parameter | Sample Statistic |
|---|---|
| Mean μ | Mean x̄ |
| Variance σ² | Variance s² |
| Standard Deviation σ | Standard Deviation s |
| Proportion p | Sample Proportion p̂ |
| Correlation ρ | Correlation r |
| Regression Coefficient β | Estimated Coefficient b |
핵심 구조는 모두 같습니다.
Unknown Population Parameter
↓
Sample
↓
Observed Statistic
↓
Parameter Estimate
Statistic을 계산하면 Parameter를 안다고 말할 수 있을까?
정확히는 Estimate를 얻었다고 표현하는 것이 적절합니다.
예를 들어:
Sample Mean = 1200
이라고 해서 Population Mean이 정확히 1200이라고 확정할 수는 없습니다.
대신:
“Population Mean의 Point Estimate는 1200이다.”
라고 표현할 수 있습니다.
그 다음 Confidence Interval을 통해 Estimate의 Uncertainty를 함께 제시할 수 있습니다.
Sample이 Representative하지 않으면 Statistic은 어떻게 될까?
Statistic 자체는 Sample에서 정확하게 계산될 수 있습니다.
하지만 Population Parameter Estimate로서의 Validity가 떨어질 수 있습니다.
예를 들어 특정 Income Group만 Sample에 포함했다면 Sample Mean Income은 그 Sample에서는 정확합니다.
하지만 전체 Population Mean Income을 추정하기에는 Bias가 있을 수 있습니다.
즉:
Statistic의 계산 정확성
과
Parameter Estimate의 타당성
은 별개의 문제입니다.
SAS가 계산한 Statistic은 항상 정확할까?
SAS는 입력된 Data와 명령에 따라 Statistic을 계산합니다.
하지만 다음이 잘못되면 결과도 문제가 됩니다.
- 잘못된 Dataset
- 잘못된 Variable
- Coding Error
- Missing 처리 오류
- Measurement Error
즉 Software가 정확하게 계산하더라도 Statistical Meaning까지 자동으로 보장되지는 않습니다.
정확한 계산과 올바른 추정은 서로 다른 문제입니다.
Parameter 추정에서 Sample Design이 중요한 이유
Statistic은 Sample Selection Method의 영향을 받습니다.
Simple Random Sample이라면 일반적인 Inference Framework를 사용할 수 있는 상황이 많습니다.
하지만 Stratified, Cluster, Weighted Survey 같은 복잡한 Design에서는 Statistic과 Standard Error 계산에 Sampling Design을 반영해야 할 수 있습니다.
따라서 Parameter Estimation은 단순 Formula만의 문제가 아니라 Sampling Design과도 연결됩니다.
Estimate의 Precision은 무엇으로 확인할까?
대표적으로 Standard Error와 Confidence Interval을 사용할 수 있습니다.
예를 들어 두 Estimate가 있다고 가정해보겠습니다.
Estimate A
Mean = 100
95% CI = 50 ~ 150
Estimate B
Mean = 100
95% CI = 98 ~ 102
둘의 Point Estimate는 같지만 B가 훨씬 정밀합니다.
따라서 Parameter Estimate를 평가할 때는 Estimate 값뿐 아니라 Precision을 함께 확인해야 합니다.
Precision과 Bias는 다시 구분해야 한다
Estimate가 매우 정밀해도 Bias가 있을 수 있습니다.
예를 들어 True Parameter가 120인데 반복적으로 Estimate가:
100
101
99
100
처럼 나온다고 가정해보겠습니다.
값들은 서로 매우 가깝습니다.
Precision은 높습니다.
하지만 True Parameter 120과는 멀리 떨어져 있습니다.
즉 Bias가 존재합니다.
따라서 좋은 Estimation에는:
Low Variability
Low Bias
가 함께 중요합니다.
Unbiased Estimator란 무엇인가?
반복 Sampling에서 Estimator의 평균이 Population Parameter와 같다면 Unbiased Estimator라고 합니다.
즉 매우 많은 Random Sample에서 Statistic을 계산했을 때 그 중심이 True Parameter와 일치하는 성질입니다.
이는 하나의 Sample Estimate가 반드시 Parameter와 같다는 의미는 아닙니다.
각 Sample Estimate는 여전히 크거나 작을 수 있습니다.
Consistency란 무엇인가?
Estimator의 또 다른 좋은 성질로 Sample Size가 증가할수록 True Parameter에 가까워지는 성질을 생각할 수 있습니다.
이러한 개념들은 Estimator의 Statistical Quality를 평가하는 데 사용됩니다.
이 글에서는 기본 구조에 집중하지만 중요한 점은 Statistic이라고 해서 모든 Statistic이 동일하게 좋은 Parameter Estimator는 아니라는 것입니다.
Sample Size가 너무 작으면 어떤 문제가 생길까?
작은 Sample에서는 Statistic의 Sampling Variability가 클 수 있습니다.
예를 들어 n=5인 Sample Mean은 Population에서 우연히 선택된 몇 개 Observation의 영향을 크게 받을 수 있습니다.
또 Outlier 하나가 Statistic에 큰 영향을 줄 수 있습니다.
따라서 Estimate의 Precision이 낮을 수 있습니다.
하지만 Sample Size만 늘리는 것이 Sampling Bias를 해결하지는 않습니다.
Statistic의 정확도를 높이는 가장 단순한 방법은 Sample Size 증가일까?
일부 Random Error를 줄이는 데 Sample Size 증가가 도움이 될 수 있습니다.
하지만 다음 조건도 중요합니다.
- Representative Sampling
- Accurate Measurement
- Correct Data
- Appropriate Statistical Method
따라서:
Large Sample
만으로 좋은 Parameter Estimate를 보장할 수 없습니다.
Statistical Significance도 Parameter와 관련 있을까?
Hypothesis Test에서 p-value는 Sample Evidence를 이용해 Population Parameter에 대한 Null Hypothesis와의 Compatibility를 평가합니다.
예를 들어:
H₀: β₁ = 0
은 Population Regression Slope가 0이라는 Hypothesis입니다.
Sample에서 Estimate된 b₁과 Standard Error를 이용해 Test를 수행합니다.
즉 Statistical Significance 역시 Population Parameter와 Sample Statistic 사이의 관계에서 만들어집니다.
Confidence Interval과 Hypothesis Test는 같은 Parameter를 다른 방식으로 볼까?
밀접하게 연결됩니다.
예를 들어 Population Mean Difference Parameter가 0인지 확인한다고 가정해보겠습니다.
Confidence Interval에서 0을 포함하는지 확인할 수 있고,
Hypothesis Test에서는:
H₀: Difference = 0
을 평가할 수 있습니다.
둘 다 Sample Statistic과 Sampling Uncertainty를 이용해 Population Parameter에 대해 추론합니다.
Parameter Estimate와 Practical Meaning은 별개다
예를 들어 Sample에서 Treatment Difference가:
0.2
로 Estimate되었고 매우 큰 Sample 때문에 p-value가 매우 작다고 가정해보겠습니다.
Statistically Significant할 수 있습니다.
하지만 Difference 0.2가 실제 임상적으로 중요한지는 별도의 질문입니다.
즉:
Parameter Estimate
↓
Effect Magnitude
Statistical Uncertainty
↓
SE / CI / p-value
Practical Significance
↓
실제 중요성
을 구분해야 합니다.
Model Parameter는 왜 해석이 중요한가?
Regression에서는 단순히 p-value만 보는 것이 아니라 Parameter Estimate가 실제로 무엇을 의미하는지 이해해야 합니다.
예를 들어:
Age Coefficient = 0.5
라면 다른 조건이 일정하다는 Model 구조 안에서 Age 1단위 증가와 Response의 평균 변화가 어떻게 연결되는지를 나타낼 수 있습니다.
즉 Parameter는 Statistical Model의 실질적인 의미를 담고 있습니다.
SAS Output에서 Estimate라는 단어가 자주 나오는 이유
SAS Regression이나 Logistic Regression Output에서는 Parameter Estimates 같은 표현을 볼 수 있습니다.
그 이유는 Output에 나타난 Coefficient가 Population Parameter 자체를 직접 관찰한 값이 아니라 Sample Data를 통해 추정한 값이기 때문입니다.
이 표현을 이해하면 SAS Result를 더 정확하게 읽을 수 있습니다.
Sample Result와 Population Claim을 구분하는 문장
예를 들어 Sample Mean이 68이라고 가정해보겠습니다.
Sample Description
“분석 Sample의 평균 Age는 68세였다.”
이는 Sample Statistic에 대한 직접적인 문장입니다.
Population Estimation
“Target Population의 평균 Age는 약 68세로 추정된다.”
이는 Population Parameter에 대한 Inferential Statement입니다.
두 문장을 구분하는 습관이 중요합니다.
Parameter와 Statistic을 가장 쉽게 구분하는 방법
다음 질문을 하면 됩니다.
“이 숫자는 전체 Population의 실제 특성인가, 아니면 내가 뽑은 Sample에서 계산한 값인가?”
전체 Population의 특성이면:
Parameter
Sample에서 계산한 값이면:
Statistic
입니다.
그리고 대부분의 실제 연구에서는 Parameter를 모르기 때문에 Statistic을 이용해 추정합니다.
Parameter와 Statistic의 전체 구조
지금까지의 관계를 하나로 정리하면 다음과 같습니다.
Population
↓
Unknown Characteristic
↓
Parameter
μ, σ², σ, p, β 등
↓
Sampling
↓
Sample
↓
Observed Data
↓
Statistic
x̄, s², s, p̂, b 등
↓
Standard Error
↓
Confidence Interval / Hypothesis Test
↓
Statistical Inference
↓
Population Parameter에 대한 결론
Parameter와 Statistic을 연결하는 과정이 Inferential Statistics의 핵심입니다.
흔한 오해 정리
“Sample Mean은 Population Mean이다”
아닙니다.
Sample Mean은 Population Mean을 추정하는 Statistic입니다.
“Parameter는 Sample에서 계산한다”
아닙니다.
Parameter는 Population의 특성입니다.
Sample에서 계산하는 것은 Statistic입니다.
“Statistic이 Parameter와 다르면 Sample이 잘못된 것이다”
반드시 그렇지 않습니다.
Random Sampling에서도 자연스러운 Sampling Variability가 발생합니다.
“Sample Size가 커지면 Statistic과 Parameter가 반드시 같아진다”
정확히 동일해진다고 보장할 수는 없지만 적절한 조건에서는 Estimate의 Precision이 높아지는 경향이 있습니다.
“큰 Sample이면 Bias가 없다”
아닙니다.
Large Sample도 Sampling Bias를 가질 수 있습니다.
“Point Estimate만 알면 Parameter를 충분히 알 수 있다”
아닙니다.
Sampling Uncertainty를 확인하기 위해 Standard Error와 Confidence Interval이 중요합니다.
“SAS Output의 Parameter Estimate가 Population Parameter 자체다”
아닙니다.
Sample Data를 이용한 Estimate입니다.
“Parameter는 평균과 표준편차에만 존재한다”
아닙니다.
Proportion, Correlation, Regression Coefficient 등 여러 Population Characteristic이 Parameter가 될 수 있습니다.
왜 Parameter와 Statistic을 이해해야 할까?
앞으로 배우게 될 개념 대부분이 이 차이를 전제로 합니다.
Confidence Interval
↓
Statistic으로 Parameter의 Range 추정
Hypothesis Test
↓
Statistic을 이용해 Parameter Hypothesis 평가
ANOVA
↓
Sample Mean으로 Population Mean 비교
Regression
↓
Sample Coefficient로 Population Regression Parameter 추정
Logistic Regression
↓
Sample Data로 Population Odds Relationship 추정
즉 Parameter와 Statistic을 구분하지 않으면 Sample Result와 Population Inference를 혼동하기 쉽습니다.
핵심 정리
Parameter는 Population의 특성을 나타내는 값입니다.
Statistic은 Sample에서 계산한 값입니다.
예를 들어:
Population Mean
μ
↓
Parameter
Sample Mean
x̄
↓
Statistic
입니다.
같은 구조로:
Population Variance
σ²
↓
Sample Variance
s²
그리고:
Population Standard Deviation
σ
↓
Sample Standard Deviation
s
로 연결됩니다.
실제 연구에서는 Population 전체를 관찰할 수 없는 경우가 많기 때문에 Parameter는 대개 Unknown입니다.
따라서 다음 구조를 사용합니다.
Unknown Population Parameter
↓
Random / Representative Sample
↓
Sample Statistic
↓
Point Estimate
↓
Standard Error
↓
Confidence Interval / Hypothesis Test
↓
Population Inference
Statistic은 Population Parameter 그 자체가 아니라, 우리가 직접 알 수 없는 Parameter에 접근하기 위해 Sample에서 얻는 정보입니다.
이 차이를 이해하면 통계 결과를 단순히 계산된 숫자로 보는 것을 넘어 Sample에서 얻은 Evidence를 Population에 대해 어떻게 확장하는지 이해할 수 있습니다.
함께 읽으면 좋은 글
- Population과 Sample의 차이: 표본으로 모집단을 추론할 수 있는 원리
- Random Sampling의 중요성: 대표성 없는 표본이 통계 결과를 왜곡하는 이유
- Descriptive Statistics의 목적: 본격적인 분석 전에 데이터를 진단해야 하는 이유
- Descriptive와 Inferential Statistics의 차이: 표본 분석에서 모집단 추론으로 확장하는 과정
- Confidence Interval의 의미: 단일 추정값보다 범위 추정이 중요한 이유
참고한 자료
- SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
- Fundamental Statistical Concepts
- Population Parameters and Sample Statistics
- Descriptive and Inferential Statistics
- Confidence Intervals for the Mean
- Statistical Estimation and Regression




댓글 0
첫 댓글을 남겨보세요.