본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

Population과 Sample의 차이: 표본으로 모집단을 추론할 수 있는 원리

읽는 시간 약 58분

통계분석에서는 수집한 Data 자체를 정확하게 요약하는 것만큼 중요한 목적이 하나 더 있습니다.

바로 일부 Data를 이용해 더 큰 집단의 특성을 추론하는 것입니다.

예를 들어 한 지역의 모든 학생의 평균 SAT Score를 알고 싶다고 가정해보겠습니다.

지역 내 모든 학생을 조사할 수 있다면 가장 직접적이겠지만 실제 연구에서는 시간, 비용, 접근성 등의 문제로 전체 Population을 측정하기 어려운 경우가 많습니다.

그래서 전체 학생 가운데 일부를 선택하여 점수를 조사하고, 그 결과를 이용해 전체 학생의 평균 점수를 추정합니다.

이때 등장하는 두 개념이 Population과 Sample입니다.

Population은 연구자가 관심을 가지는 전체 집단이고, Sample은 그 Population에서 실제 분석을 위해 선택한 일부 Observation입니다.

첨부 교재에서는 Population을 관심 대상이 되는 Group의 전체 구성원으로, Sample을 Population에서 추출한 일부 집합으로 설명합니다. 또한 이 과정에서 Sample이 Population을 대표한다고 가정하는 것이 중요하다고 제시합니다.

Population이란 무엇인가?

Population은 분석자가 궁극적으로 알고 싶은 전체 대상 집합입니다.

한국어로는 일반적으로 모집단이라고 합니다.

예를 들어 연구 질문이:

“Carver County Magnet School 학생들의 평균 SAT Score가 1200인가?”

라고 가정해보겠습니다.

이 질문에서 관심 대상은 실제로 조사한 몇 명의 학생만이 아닙니다.

궁극적으로 알고 싶은 대상은 해당 지역의 Magnet School 학생 전체입니다.

따라서:

Population

Carver County Magnet School의 관심 대상 학생 전체

라고 볼 수 있습니다.

Population은 반드시 사람의 집합일까?

아닙니다.

Population은 연구 목적에 따라 매우 다양하게 정의될 수 있습니다.

예를 들어 다음 모두 Population이 될 수 있습니다.

  • 특정 지역의 학생 전체
  • 특정 병원의 Patient 전체
  • 공장에서 생산되는 제품 전체
  • 특정 기간의 Transaction 전체
  • 어떤 기업의 Customer 전체
  • 특정 종류의 Vehicle 전체
  • Laboratory에서 생산 가능한 Measurement 전체

즉 Population은 반드시 “사람 전체”를 의미하는 것이 아니라 Research Question이 적용되는 전체 Observation의 집합이라고 이해하면 됩니다.

Sample이란 무엇인가?

Sample은 Population 전체를 조사하는 대신 Population에서 실제로 선택하여 관찰한 일부 대상입니다.

한국어로는 표본이라고 합니다.

예를 들어 Population이 10,000명의 학생이고 그중 100명을 조사했다면:

Population

10,000명

일부 선택

Sample

100명

이 됩니다.

통계분석에서는 이 100명의 Data를 이용해 Population의 특성을 추정합니다.

첨부 교재에서는 Sample을 어떻게 사용하고 있을까?

첨부 교재의 SAT Score Example에서는 교육위원회가 Magnet School 학생들의 평균 SAT Score가 1200이라는 목표를 달성했는지 평가하려고 합니다.

이를 위해 District의 Magnet School 학생 전체를 조사하는 대신 80명의 학생을 Random하게 선택하여 SAT Total Score를 기록합니다.

즉 구조는 다음과 같습니다.

Population

District Magnet School Students

Random Selection

Sample

80 Students

SAT Score 측정

Sample 분석

Population에 대한 결론

교재에서는 80명의 학생이 Magnet School 학생들 가운데 Random하게 선택되었다고 설명합니다.

왜 Population 전체를 조사하지 않을까?

Population 전체를 조사하는 것을 Census라고 생각할 수 있습니다.

이론적으로 모든 구성원의 값을 정확하게 측정할 수 있다면 Sample을 이용한 추론이 필요하지 않을 수도 있습니다.

하지만 실제로는 여러 제한이 존재합니다.

예를 들어:

  • Population이 너무 큼
  • 조사 비용이 높음
  • 시간이 오래 걸림
  • 모든 대상에 접근하기 어려움
  • Measurement 자체가 파괴적일 수 있음
  • Population이 계속 변함

등의 문제가 있을 수 있습니다.

따라서 실제 Statistics에서는 Population 전체를 조사하는 대신 Sample을 이용합니다.

Sample을 사용하는 가장 중요한 이유

Sample을 사용하는 목적은 단순히 적은 Data를 분석하기 위해서가 아닙니다.

핵심은 다음 구조입니다.

Population

직접 모두 측정하기 어려움

Sample

실제 Data 수집

Sample Statistic 계산

Population 특성 추정

즉 Sample은 Population에 대해 알아보기 위한 정보의 창구입니다.

Statistical Inference의 핵심은 Sample에서 관찰한 정보를 Population에 대해 확장하는 것입니다.

첨부 교재에서도 Inferential Statistics의 목적을 Sample을 사용하여 알려지지 않은 Population Parameter를 Estimate 또는 Predict하고, Population의 특성에 대해 확률적인 진술을 하는 것으로 설명합니다.

Sample Mean과 Population Mean은 같은 것일까?

일반적으로 같다고 기대해서는 안 됩니다.

예를 들어 Population의 실제 평균이:

μ = 1200

이라고 가정해보겠습니다.

Population에서 80명을 Random Sampling하면 Sample Mean은:

1191

이 될 수도 있고,

다른 Sample에서는:

1213

이 될 수도 있습니다.

또 다른 Sample에서는:

1204

가 나올 수도 있습니다.

즉:

Population

실제 Mean 하나 존재

하지만

Random Sample 1

Sample Mean A

Random Sample 2

Sample Mean B

Random Sample 3

Sample Mean C

처럼 Sample마다 결과가 달라질 수 있습니다.

왜 Sample마다 평균이 달라질까?

Random Sampling을 하면 Population에서 선택되는 구성원이 매번 달라질 수 있기 때문입니다.

예를 들어 Population에 다양한 SAT Score가 존재한다고 가정해보겠습니다.

우연히 점수가 높은 학생이 조금 더 많이 선택된 Sample은 Mean이 높게 나올 수 있습니다.

반대로 점수가 낮은 학생이 조금 더 많이 포함되면 Mean이 낮아질 수 있습니다.

이러한 차이를 Sampling Variability 관점에서 이해할 수 있습니다.

Sample Statistic은 Population Parameter를 추정하지만 Sample이 달라지면 Statistic도 달라질 수 있습니다.

그렇다면 Sample을 믿을 수 있을까?

Sample이 Population과 완전히 같은 결과를 만들어야만 유용한 것은 아닙니다.

Statistics는 Sample마다 어느 정도 Variation이 발생한다는 사실을 인정하고 그 불확실성을 정량화합니다.

예를 들어:

  • Standard Error
  • Confidence Interval
  • Hypothesis Test
  • p-value

등의 개념이 등장합니다.

즉 Sample에서 Population을 추론한다는 것은:

“Sample Mean이 Population Mean과 정확히 같다.”

라고 가정하는 것이 아닙니다.

대신:

“Sample에서 얻은 Estimate에는 Sampling Error가 있으며, 그 불확실성까지 고려하여 Population에 대해 추론한다.”

라는 접근입니다.

Parameter와 Statistic은 어떻게 연결될까?

Population과 Sample의 차이는 Parameter와 Statistic으로 연결됩니다.

Population

Parameter

Sample

Statistic

입니다.

예를 들어 Population Mean은:

μ

로 나타낼 수 있고,

Sample Mean은:

로 나타낼 수 있습니다.

첨부 교재에서는 Population Parameter와 Sample Statistic을 다음과 같이 연결합니다.

  • Population Mean μ ↔ Sample Mean x̄
  • Population Variance σ² ↔ Sample Variance s²
  • Population Standard Deviation σ ↔ Sample Standard Deviation s

그리고 Sample Statistic을 이용해 Population Parameter를 Approximate한다고 설명합니다.

Population Parameter는 왜 대부분 알 수 없을까?

Population 전체를 모두 측정하지 않는다면 Population Mean이나 Standard Deviation을 정확하게 계산할 수 없습니다.

따라서 Parameter는 대개 Unknown Value입니다.

예를 들어 Magnet School 학생 전체의 SAT 평균이 무엇인지 알고 싶기 때문에 연구를 시작한 것입니다.

이미 실제 Population Mean을 알고 있다면 굳이 Sample을 이용해 추론할 필요가 없습니다.

따라서:

Unknown Population Parameter

Sample 수집

Sample Statistic 계산

Population Parameter Estimate

라는 구조가 만들어집니다.

Sample Statistic은 실제로 무엇을 의미할까?

Statistic은 Sample에서 계산한 수치입니다.

예를 들어 80명의 SAT Score를 이용해:

Sample Mean

1190.6

Sample Standard Deviation

147.06

을 계산할 수 있습니다.

첨부 교재의 Confidence Interval Section에서도 Sample Statistic을 Population Parameter를 추정하기 위한 Point Estimate로 설명하고 있습니다.

즉 1190.6이라는 값은 단순히 80명의 평균이라는 의미뿐 아니라 Population Mean을 추정하기 위한 정보로 사용됩니다.

Point Estimate란 무엇인가?

Point Estimate는 Sample Statistic 하나를 이용하여 Population Parameter를 추정하는 방식입니다.

예를 들어:

Sample Mean = 1190.6

이라면 Population Mean의 Point Estimate를:

1190.6

이라고 할 수 있습니다.

전체 구조는:

Population Mean μ

Unknown

Sample

Sample Mean x̄ = 1190.6

μ의 Point Estimate

입니다.

하지만 여기에는 중요한 한계가 있습니다.

Point Estimate 하나만으로 충분할까?

Sample Mean 1190.6이 Population Mean과 정확히 일치한다고 보장할 수 없습니다.

Sample을 다시 뽑으면 Mean이 달라질 수 있기 때문입니다.

따라서 Statistics에서는 Point Estimate뿐 아니라 Estimate의 불확실성도 함께 고려합니다.

이때 등장하는 대표적인 개념이:

Standard Error

Confidence Interval

입니다.

Standard Error는 왜 필요한가?

Sample Mean은 Sample마다 달라질 수 있습니다.

Standard Error는 Sample Mean의 Sampling Variability를 나타내는 Statistic입니다.

첨부 교재에서는 Sample Standard Deviation은 Data 자체의 변동성을 측정하고, Standard Error of the Mean은 Sample Mean들의 변동성을 측정하는 값이라고 구분합니다.

즉:

Standard Deviation

Sample 안에서 Observation들이 얼마나 퍼져 있는가?

반면:

Standard Error

반복 Sampling 시 Sample Mean이 얼마나 달라질 수 있는가?

입니다.

Sample Size가 커지면 무엇이 달라질까?

Standard Error of the Mean은 기본적으로:

Sample Standard Deviation

√Sample Size

로 나누는 구조입니다.

따라서 다른 조건이 비슷하다면 Sample Size가 증가할수록 Standard Error는 작아지는 경향이 있습니다.

이는 Sample Mean이 Population Mean을 더 정밀하게 Estimate할 수 있음을 의미합니다.

첨부 교재에서도 Sample Size를 증가시키면 Estimate의 Precision을 높일 수 있다고 설명합니다.

큰 Sample의 장점은 단순히 Data가 많다는 것이 아니라 Population Parameter를 보다 정밀하게 추정할 가능성을 높인다는 데 있습니다.

Sample Size가 크면 무조건 좋은 Sample일까?

아닙니다.

매우 중요한 차이입니다.

Sample Size가 아무리 커도 Sample Selection 과정에 Bias가 있다면 Population을 제대로 대표하지 못할 수 있습니다.

예를 들어 1,000,000명의 Population이 있는데 특정 Website 사용자만 100,000명 조사했다고 가정해보겠습니다.

Sample Size는 매우 큽니다.

하지만 Website를 사용하지 않는 Population이 체계적으로 제외된다면 Sample은 전체 Population을 대표하지 못할 수 있습니다.

따라서 다음 두 요소는 별개입니다.

Sample Size

Precision과 관련

그리고

Representativeness

Bias와 Generalization에 관련

입니다.

Representative Sample이란 무엇인가?

Representative Sample은 Population의 중요한 특성을 왜곡하지 않고 충분히 반영하는 Sample을 의미합니다.

첨부 교재에서는 이 Course의 기본 가정으로 추출된 Sample이 Population을 Representative한다고 명시합니다.

Sample이 Population을 잘 대표해야 Sample에서 얻은 결과를 Population으로 Generalize하는 것이 합리적입니다.

Random Sampling이 중요한 이유

Random Sampling에서는 Population의 구성원이 Sample에 포함될 기회를 Random Mechanism을 통해 갖습니다.

Random Sampling은 특정 Group이 의도적으로 많이 또는 적게 포함되는 Selection Bias를 줄이는 데 도움이 됩니다.

예를 들어 Magnet School 학생 전체에서 80명을 Random하게 선택하면 Teacher가 자신이 잘 아는 학생만 선택하는 것보다 Population을 대표할 가능성이 높아질 수 있습니다.

Convenience Sampling이란 무엇인가?

Convenience Sampling은 조사하기 쉬운 대상을 중심으로 Sample을 구성하는 방식입니다.

예를 들어 Ms. Chao가 District 전체 학생 대신 자신의 Class 학생만 조사한다고 가정해보겠습니다.

접근하기 쉽기 때문에 조사 비용은 줄어듭니다.

하지만 문제가 있습니다.

그 Class 학생들의 SAT Score가 District의 Magnet School 학생 전체와 다른 특성을 가질 수 있기 때문입니다.

첨부 교재에서도 쉽게 접근할 수 있는 학생만 선택하는 Convenience Sampling은 Biased Sample을 만들 수 있으며, Bias가 있는 Sample은 Population을 Representative하지 못한다고 설명합니다.

Biased Sample이란 무엇인가?

Biased Sample은 Population의 특성을 체계적으로 잘못 반영하는 Sample입니다.

예를 들어 실제 Population이:

High Score 학생 50%

Low Score 학생 50%

인데 Sample에:

High Score 학생 80%

Low Score 학생 20%

가 들어갔다면 Sample Mean은 Population Mean보다 높게 나타날 가능성이 있습니다.

중요한 점은 Bias가 단순한 Random Error와 다르다는 것입니다.

Sampling Error와 Bias는 같은 것일까?

아닙니다.

Sampling Error

Random Sampling 과정에서 우연히 발생하는 Sample과 Population의 차이

Bias

Sampling Method나 Measurement 과정 때문에 특정 방향으로 체계적으로 발생하는 왜곡

입니다.

Sampling Error는 Sample Size 증가 등으로 줄어들 수 있습니다.

하지만 Bias는 Sample Size를 단순히 늘린다고 해결되지 않을 수 있습니다.

잘못 선택된 Sample을 크게 만드는 것은 잘못된 Population Representation을 더 정밀하게 계산하는 결과가 될 수도 있습니다.

큰 Sample에서도 Bias가 남는 이유

예를 들어 Online Survey를 실시한다고 가정해보겠습니다.

Population은 모든 성인입니다.

하지만 Survey Link를 특정 Social Media Platform에서만 배포했습니다.

10명보다 100,000명이 응답하면 Sampling Variability는 줄어들 수 있습니다.

하지만 그 Platform을 사용하지 않는 사람들은 여전히 Sample에서 제외되어 있습니다.

따라서:

Large N

Representative Sample 보장

입니다.

Population을 먼저 명확하게 정의해야 하는 이유

“한국인의 평균 키를 조사한다.”

라는 질문은 얼핏 명확해 보입니다.

하지만 Population을 구체적으로 생각하면 질문이 생깁니다.

  • 모든 연령인가?
  • 성인만인가?
  • 현재 한국 거주자인가?
  • 대한민국 국적자인가?
  • 남녀 모두인가?
  • 어느 시점의 Population인가?

Population Definition이 달라지면 Sample을 뽑아야 하는 범위도 달라집니다.

따라서 Research Question을 Statistical Question으로 바꾸려면 Population을 명확하게 정의해야 합니다.

Target Population과 Accessible Population을 구분할 수 있을까?

실제 연구에서는 연구자가 궁극적으로 관심을 가지는 Population과 현실적으로 Sampling할 수 있는 Population이 다를 수 있습니다.

예를 들어:

Target Population

전국의 모든 특정 질환 Patient

하지만 실제 연구 기관이 접근할 수 있는 대상은:

Accessible Population

참여 병원에 방문한 Patient

일 수 있습니다.

따라서 Study Sample이 어느 Population을 대표할 수 있는지를 신중하게 판단해야 합니다.

Sample에서 Population으로 결론을 확장하는 것을 무엇이라고 할까?

이 과정이 Statistical Inference입니다.

전체 흐름은:

Population

일부 추출

Sample

Descriptive Statistics

Estimate / Test

Inferential Statistics

Population에 대한 결론

입니다.

첨부 교재에서는 Statistical Inference의 목적을 Sample을 사용하여 Unknown Population Parameter를 추정하고 Population Attribute에 대해 Probabilistic Statement를 만드는 것으로 설명합니다.

Descriptive Statistics와 Inferential Statistics는 어떻게 다를까?

Descriptive Statistics

현재 Sample에 존재하는 Data를 설명합니다.

예:

  • Sample Mean
  • Median
  • Standard Deviation
  • Minimum
  • Maximum
  • Distribution

Inferential Statistics

Sample의 정보를 이용해 Population에 대해 추론합니다.

예:

  • Population Mean 추정
  • Confidence Interval
  • Hypothesis Test
  • Regression Parameter 추정

즉 Sample Mean을 계산하는 것 자체는 Descriptive Statistics이지만 그 Mean을 이용해 Population Mean을 추정하면 Inferential Statistics로 확장됩니다.

왜 추론하기 전에 Sample을 먼저 살펴봐야 할까?

첨부 교재에서도 Random Sample을 얻은 뒤 바로 Inferential Statistics로 넘어가는 것이 아니라 먼저 Data를 Explore하고 Describe해야 한다고 설명합니다.

그 이유는 다음과 같습니다.

  • Data Error 확인
  • Unusual Value 확인
  • Distribution Shape 확인
  • Extreme Value 확인
  • Data Quality 확인

예를 들어 SAT Score에:

1200

1300

1180

1250

12500

이 있다고 가정해보겠습니다.

12500이 Data Entry Error라면 Sample Mean이 크게 왜곡됩니다.

이 상태에서 Population Mean을 추정하면 잘못된 결론으로 이어질 수 있습니다.

Sample이 Random이면 Data Error는 없어질까?

아닙니다.

Random Sampling은 누구를 Sample에 포함시킬지에 관한 문제입니다.

Data Error는 Measurement나 Data Entry 과정에서 별도로 발생할 수 있습니다.

따라서:

Sampling Quality

Data Quality

둘 다 필요합니다.

좋은 Sample을 뽑았더라도 Measurement Error가 심하면 분석 결과가 왜곡될 수 있습니다.

Population Parameter와 Sample Statistic의 전체 관계

다음과 같이 정리할 수 있습니다.

Population

Unknown Parameter

예:

μ

σ²

σ

Random Sample

Sample

Observed Statistic

예:

s

Parameter Estimate

즉 Sample Statistic은 Population Parameter에 대한 정보를 제공합니다.

Sample Mean이 Population Mean을 정확히 맞힐 확률은 높을까?

Continuous Measurement라면 정확히 같은 숫자가 나와야만 성공한 Sample이라고 생각할 필요는 없습니다.

Statistics는 Sample Mean이 Population Mean 주변에서 Variation을 갖는다는 점을 전제로 합니다.

따라서 중요한 것은 정확히 같은 값이 아니라 얼마나 가까운 Estimate를 얻었고 그 Estimate가 얼마나 불확실한지입니다.

이를 Confidence Interval과 Standard Error를 통해 표현할 수 있습니다.

Confidence Interval은 왜 Population과 Sample을 연결할까?

Point Estimate 하나만 보면 Population Parameter가 어느 정도 불확실한지 알 수 없습니다.

Confidence Interval은 Sample Statistic 주변에 범위를 만들어 Population Parameter에 대한 Uncertainty를 표현합니다.

첨부 교재에서는 Confidence Interval을 Sample Statistic 주변의 Upper/Lower Bound로 정의하고, 반복적으로 Sample을 뽑아 95% Confidence Interval을 계산한다면 약 95%의 Interval이 Population Mean을 포함하는 방식으로 설명합니다.

즉:

Sample

Sample Mean

Standard Error

Confidence Interval

Population Mean 추론

으로 이어집니다.

서로 다른 Sample은 서로 다른 Confidence Interval을 만들까?

그렇습니다.

Sample이 달라지면:

  • Sample Mean
  • Standard Deviation
  • Standard Error

등이 달라질 수 있습니다.

따라서 Confidence Interval도 달라집니다.

첨부 교재에서도 같은 Population에서 서로 다른 연구자가 Sample을 뽑으면 각 Sample Mean이 달라질 수 있고, 일부 Confidence Interval은 True Population Mean을 포함하지 않을 수도 있다고 설명합니다.

이것은 통계적 추론이 항상 일정한 불확실성을 포함한다는 의미입니다.

95% Confidence Interval이면 Population Mean이 95% 확률로 안에 있을까?

이 부분은 뒤의 Confidence Interval 글에서 더 자세히 다루게 됩니다.

중요한 점은 Confidence Interval을 Sampling Procedure의 장기적 성질과 연결해서 이해하는 것입니다.

동일한 방식으로 많은 Sample을 반복해서 뽑고 Interval을 계산하면 약 95%가 True Population Parameter를 포함하도록 구성되는 방식입니다.

따라서 Sample과 Population을 이해해야 Confidence Interval을 정확히 이해할 수 있습니다.

Hypothesis Testing도 Population을 대상으로 할까?

그렇습니다.

예를 들어 교육위원회의 Goal이:

Population Mean SAT Score = 1200

이라고 가정해보겠습니다.

실제로는 Population 전체를 측정하지 않고 Sample을 이용해 다음 Hypothesis를 평가할 수 있습니다.

Null Hypothesis

Population Mean μ = 1200

Sample Data 사용

Sample Mean과 Sampling Variability 계산

Hypothesis Test

Population Parameter에 대한 판단

즉 Hypothesis Test는 Sample 자체가 1200인지 묻는 것이 아니라 Population Mean에 대한 Hypothesis를 Sample Evidence로 평가하는 것입니다.

Sample Mean이 1190이면 Population Mean도 1190일까?

그렇게 단정할 수 없습니다.

1190은 Sample Statistic입니다.

Population Mean은 Unknown Parameter입니다.

Sample Mean이 1190이라면:

μ의 Estimate = 1190

이라고 할 수 있지만:

μ = 정확히 1190

이라고 확정할 수는 없습니다.

이 차이를 이해하는 것이 Inferential Statistics의 시작입니다.

Population Size와 Sample Size는 어떻게 표현할까?

통계학에서는 일반적으로:

Population Size

N

Sample Size

n

처럼 표현하는 경우가 많습니다.

예를 들어:

Population N = 10,000

Sample n = 200

입니다.

하지만 실제 Statistical Precision은 단순히 n/N Ratio만으로 결정되는 것은 아닙니다.

Sampling Design과 Population Structure도 중요합니다.

Population이 매우 크면 Sample도 반드시 매우 커야 할까?

Population이 크다는 이유만으로 Sample을 같은 비율로 무조건 크게 뽑아야 한다고 단정할 수는 없습니다.

필요한 Sample Size는 다음과 같은 요소와 연결됩니다.

  • 원하는 Precision
  • Variability
  • Confidence Level
  • Effect Size
  • Statistical Power
  • Sampling Design

따라서 “Population의 10%를 반드시 뽑아야 한다”와 같은 단순 규칙으로 이해하면 안 됩니다.

Sample Size 30이면 항상 충분할까?

아닙니다.

첨부 교재에서는 Central Limit Theorem과 관련하여 비교적 Symmetric한 Population에서 Sample Size 약 30을 흔한 Rule of Thumb으로 설명하지만, Data가 매우 Skewed하면 더 큰 Sample이 필요할 수 있고 30이 Magic Number는 아니라고 명시합니다.

즉:

n ≥ 30

=

모든 Statistical Problem 해결

은 아닙니다.

Sample Size는 분석 목적과 Data 특성에 따라 판단해야 합니다.

Central Limit Theorem은 Population과 Sample을 어떻게 연결할까?

Central Limit Theorem은 Sample Mean의 Distribution을 이해하는 핵심 원리입니다.

하나의 Population에서 동일한 크기의 Sample을 계속 Random하게 뽑는다고 가정해보겠습니다.

각 Sample마다 Mean을 계산합니다.

Sample 1

Mean 1

Sample 2

Mean 2

Sample 3

Mean 3

이 Sample Means의 Distribution은 Sample Size가 충분히 커지면 특정 조건에서 Normal Distribution에 가까워집니다.

첨부 교재에서도 Population Distribution이 반드시 Normal이 아니더라도 Sample Size가 충분히 크면 Sample Means의 Distribution이 Approximate Normal이 된다고 설명합니다.

왜 Sample Mean의 Distribution이 중요할까?

우리가 실제로 얻는 것은 보통 Sample 하나뿐입니다.

하지만 Statistical Inference는 “같은 방식으로 Sample을 반복해서 뽑는다면 Statistic이 어떻게 움직일 것인가?”라는 Sampling Distribution을 이용합니다.

이 개념을 통해:

  • Standard Error
  • Confidence Interval
  • Hypothesis Test

를 계산할 수 있습니다.

즉 Population에서 Sample을 뽑는다는 단순한 과정이 이후 대부분의 Inferential Statistics 개념의 출발점입니다.

Regression에서도 Population과 Sample 개념이 필요할까?

필요합니다.

Regression에서도 실제 관심은 Sample 안의 관계만 설명하는 데서 끝나지 않는 경우가 많습니다.

예를 들어 Oxygen Consumption과 RunTime 사이의 Population Relationship을 알고 싶다고 가정해보겠습니다.

하지만 실제로는 Population 전체를 측정하지 않고 Sample Data를 이용합니다.

첨부 교재에서는 Simple Linear Regression에서도 Sample을 이용해 Unknown Population Parameters인 Intercept와 Slope를 추정하며, 큰 Representative Sample에서는 Fitted Regression Line이 Population Relationship의 좋은 Approximation이 될 수 있다고 설명합니다.

즉 Population과 Sample의 구조는 평균 비교뿐 아니라 Regression에도 그대로 적용됩니다.

Regression Coefficient도 Sample Statistic일까?

Sample Data에서 계산한 Regression Coefficient는 Population의 Unknown Regression Parameter를 추정하는 Estimate입니다.

예를 들어 Population Relationship을:

Y = β₀ + β₁X

라고 생각한다면 β₀와 β₁은 Population Parameter입니다.

실제로 Sample에서 계산한 값은 그 Parameter의 Estimate입니다.

전체 구조는:

Population

Unknown β₀, β₁

Sample Data

Regression 분석

Estimated Coefficients

Population Relationship 추정

입니다.

ANOVA에서도 Population을 추론할까?

그렇습니다.

예를 들어 세 Treatment Group의 Sample Mean이 다르다고 가정해보겠습니다.

관심 있는 질문은 단순히:

“이번 Sample에서 Mean이 다른가?”

에 그치지 않습니다.

더 중요한 질문은:

“이 Sample의 차이가 Population Group Mean의 실제 차이를 뒷받침하는가?”

입니다.

따라서 ANOVA 역시 Sample Variation을 고려하여 Population Mean Difference에 대한 Inference를 수행합니다.

Logistic Regression에서도 같은 원리가 적용될까?

마찬가지입니다.

Sample에서 관찰된 Event와 Predictor Relationship을 이용해 Population에서의 Relationship을 추정합니다.

즉:

  • ANOVA
  • Linear Regression
  • Logistic Regression
  • Confidence Interval
  • Hypothesis Testing

모두 Population과 Sample 개념 위에서 작동합니다.

Population과 Sample은 특정 통계기법 하나의 개념이 아니라 Inferential Statistics 전체를 연결하는 기본 구조입니다.

Sample이 Population을 대표하지 못하면 Regression도 문제가 될까?

그렇습니다.

예를 들어 특정 연령대만 Sample에 포함되어 있는데 결과를 모든 연령대로 Generalize하면 문제가 발생할 수 있습니다.

Sample에서 매우 정확하게 Model을 계산했더라도 Sample이 어떤 Population을 대표하는지가 제한되어 있다면 External Generalization도 제한됩니다.

이는 Regression뿐 아니라 거의 모든 Inferential Analysis에서 중요합니다.

Representative는 Population과 완전히 똑같다는 뜻일까?

아닙니다.

Sample은 Population의 일부이므로 Population의 모든 특성이 정확히 같은 비율로 나타날 필요는 없습니다.

Random Variation은 자연스럽게 존재합니다.

Representative라는 개념은 Sample이 특정 방향으로 심각하게 왜곡되지 않고 Population의 주요 특성을 합리적으로 반영하는지와 관련됩니다.

즉:

Sample ≠ Population의 축소 복사본

이지만:

Sample → Population에 대해 유효한 정보를 제공해야 함

입니다.

Sample의 Distribution과 Population Distribution은 동일해야 할까?

하나의 Random Sample에서는 Population Distribution과 완전히 동일한 Shape가 나타나지 않을 수 있습니다.

특히 Sample Size가 작으면 우연한 Variation이 큽니다.

하지만 Sampling Method가 적절하고 Sample Size가 충분하다면 Population의 중요한 특성을 더 잘 반영할 가능성이 높아집니다.

따라서 Sample Histogram 하나가 Population Histogram과 완벽하게 같아야 하는 것은 아닙니다.

Population Parameter는 고정되고 Statistic은 변할까?

Frequentist Statistics의 기본적인 관점에서는 Population Parameter는 고정되어 있지만 Unknown이고, Sample Statistic은 Sample에 따라 달라지는 Random Quantity로 생각할 수 있습니다.

예를 들어 Population Mean μ가 실제로 하나 존재합니다.

하지만:

Sample A의 x̄

Sample B의 x̄

Sample C의 x̄

는 서로 다를 수 있습니다.

따라서:

Population Parameter

Fixed but Unknown

Sample Statistic

Sample마다 Variation

이라는 구조를 이해하면 Standard Error와 Confidence Interval이 훨씬 쉽게 연결됩니다.

한 번 뽑은 Sample만 있는데 Sampling Distribution을 어떻게 알까?

실제 연구에서는 Population에서 수천 번 Sample을 다시 뽑지 않는 경우가 대부분입니다.

대신 Probability Theory와 Statistical Distribution을 이용해 Statistic의 Sampling Behavior를 Modeling합니다.

예를 들어 Sample Mean의 Standard Error와 t Distribution을 이용해 Confidence Interval을 계산할 수 있습니다.

즉 Statistics는 한 Sample을 가지고도 반복 Sampling에서 나타날 불확실성을 수학적으로 추정합니다.

Sample Data를 먼저 Description하는 이유를 다시 정리하면

Population에 대해 추론하기 전에 Sample 자체를 이해해야 합니다.

첨부 교재의 흐름도 다음과 같습니다.

Random Sample

Descriptive Statistics

Unusual Value 확인

Spread 확인

Distribution Shape 확인

Central Tendency 확인

Inferential Statistics

Population Parameter Estimate / Hypothesis Test

이 순서가 중요한 이유는 잘못된 Data에서 정교한 Statistical Test를 수행해도 좋은 결론을 얻을 수 없기 때문입니다.

Sample에서 반드시 확인해야 할 기본 항목

분석을 시작하기 전에 다음 항목을 확인할 수 있습니다.

Sample Size

실제 n은 얼마인가?

Missing Data

분석에 필요한 Data가 누락되어 있지 않은가?

Distribution

Variable은 어떻게 분포하는가?

Extreme Value

이상한 값이나 Outlier가 존재하는가?

Category Frequency

특정 Group이 지나치게 적지 않은가?

Sampling Method

Sample은 어떻게 선택되었는가?

이 요소들은 Population으로 결론을 확장하기 전에 확인해야 할 기본 정보입니다.

Random Sample이면 무조건 Representative할까?

Random Sampling은 Representative Sample을 얻는 데 중요한 방법이지만 실제로 한 번 뽑은 Sample이 Population과 완전히 동일할 것이라고 보장하지는 않습니다.

Random Sampling 자체에도 Sampling Variability가 있기 때문입니다.

또 Nonresponse나 Missing Data처럼 Sampling 이후 발생하는 문제도 있습니다.

따라서:

Random Sampling

Bias 감소에 도움

하지만

완벽한 Representativeness 보장

은 아닙니다.

Nonresponse도 Sample Bias를 만들 수 있을까?

예를 들어 Random하게 1,000명을 선택했지만 실제 Survey에는 200명만 응답했다고 가정해보겠습니다.

만약 응답한 사람과 응답하지 않은 사람의 특성이 체계적으로 다르다면 최종 Analysis Sample은 처음의 Random Sample과 다른 성격을 가질 수 있습니다.

따라서 Sampling Method뿐 아니라 최종 분석에 실제로 포함된 대상이 누구인지도 확인해야 합니다.

Analysis Population과 Sample은 어떻게 연결될까?

실제 연구에서는 처음 모집한 사람 전체와 최종 Statistical Analysis에 사용한 Sample이 다를 수 있습니다.

예를 들어:

Enrolled Subjects

1,000명

Missing / Eligibility / Analysis Rule 적용

Analysis Sample

920명

이 될 수 있습니다.

따라서 결과를 해석할 때 “1,000명을 모집했다”는 정보와 “실제 Model에는 920명이 사용되었다”는 정보를 구분해야 합니다.

SAS에서 Sample을 분석하면 Population이 자동으로 정의될까?

아닙니다.

SAS는 Dataset에 존재하는 Observation을 이용해 Statistic을 계산합니다.

하지만 그 Sample이 어떤 Population을 대표하도록 수집되었는지는 Software가 자동으로 알 수 없습니다.

예를 들어 SAS에 500명의 Patient Data가 있다고 해도 Software는 그 500명이:

  • 어느 병원에서 왔는지
  • 어떤 Inclusion Criteria를 적용했는지
  • 어떤 Population을 대표하는지

를 연구 맥락 없이 알 수 없습니다.

Population Definition과 Sampling Validity는 Statistical Software가 아니라 연구 설계와 분석자의 판단에 달려 있습니다.

SAS Result가 정확하면 Population Inference도 정확할까?

SAS는 주어진 Data와 Model에 따라 계산을 정확하게 수행할 수 있습니다.

하지만 다음 문제가 있다면 Population에 대한 결론은 제한될 수 있습니다.

  • Biased Sample
  • 잘못된 Population Definition
  • Measurement Error
  • Missing Data
  • Model Misspecification

즉:

Correct Calculation

Valid Population Inference

입니다.

Internal Validity와 Generalization을 구분해야 하는 이유

Sample 안에서 Statistical Analysis가 매우 잘 수행되었다고 해도 Sample이 Target Population을 대표하지 못한다면 결과의 Generalization이 제한될 수 있습니다.

예를 들어 특정 국가에서만 수행한 Study 결과를 전 세계 Population에 동일하게 적용할 수 있는지는 별도의 질문입니다.

따라서 Statistics에서는:

Sample 내부의 Relationship

Population으로 확장 가능한 범위

를 구분해야 합니다.

Population을 지나치게 넓게 정의하면 어떤 문제가 생길까?

예를 들어 Study Sample이 50~70세 Patient뿐인데 Population을 “모든 성인 Patient”라고 정의한다면 20대나 30대에 대한 Evidence가 Sample에 없습니다.

이 경우 Population Definition이 Sample Coverage보다 지나치게 넓을 수 있습니다.

따라서 결론은 Sample이 실제로 대표할 수 있는 범위 안에서 작성하는 것이 중요합니다.

Statistical Result에서 “Population”이 항상 실제 전 세계 전체를 뜻할까?

아닙니다.

Population은 연구 질문에 의해 정의됩니다.

예를 들어 Population은:

  • 특정 School District 학생
  • 특정 공장 생산품
  • 특정 Disease의 Eligibility Criteria를 충족하는 Patient
  • 특정 기간의 Customer Transaction

등으로 제한될 수 있습니다.

즉 Population이라는 단어를 “세상의 모든 사람”이라고 이해하면 안 됩니다.

Population과 Sample을 구분하지 않으면 어떤 문장 오류가 생길까?

예를 들어 Sample 100명의 평균이 72라고 가정해보겠습니다.

다음 두 문장은 다릅니다.

Descriptive Statement

“Sample 100명의 평균 Score는 72였다.”

이는 직접 관찰한 사실입니다.

Inferential Statement

“Population의 평균 Score는 약 72로 추정된다.”

이는 Sample을 이용한 추론입니다.

두 번째 문장에는 Sampling Uncertainty가 존재합니다.

따라서 Statistic과 Parameter를 명확히 구분해야 합니다.

“유의한 차이가 있었다”는 것도 Population Statement일까?

Hypothesis Test의 목적은 일반적으로 Population Parameter나 Population Relationship에 대한 Hypothesis를 Sample Evidence로 평가하는 것입니다.

예를 들어 Sample Group Mean이 다르다는 사실만 확인하는 것이 아니라 그 차이가 Sampling Variability만으로 설명되기 어려운지를 평가합니다.

즉 Inferential Statistics에서는 Sample Result를 Population Claim과 연결할 때 Probability Framework를 사용합니다.

Population과 Sample을 가장 쉽게 기억하는 방법

다음 질문을 사용할 수 있습니다.

Population

“궁극적으로 누구 또는 무엇에 대해 결론을 내리고 싶은가?”

Sample

“그 결론을 위해 실제로 누구 또는 무엇을 측정했는가?”

예를 들어:

궁극적으로 District 학생 전체에 대해 알고 싶음

Population

실제로 80명만 측정

Sample

입니다.

Population에서 Sample로, 다시 Population으로

Statistical Analysis의 전체 흐름을 보면 흥미로운 구조가 나타납니다.

처음에는 Population에서 시작합니다.

Population

Research Question

Sampling

Sample

Data Collection

Descriptive Statistics

Inferential Statistics

Population에 대한 Conclusion

즉 Analysis의 방향은:

Population → Sample → Population

입니다.

Population에서 일부를 뽑아 Sample을 만들고, Sample에서 얻은 Evidence를 다시 Population에 대한 결론으로 확장하는 것이 Statistical Inference의 기본 구조입니다.

흔한 오해 정리

“Population은 Data가 가장 많은 Dataset을 의미한다”

아닙니다.

Population은 연구자가 궁극적으로 관심을 가지는 전체 대상 집합입니다.

“Sample은 작은 Population이다”

Sample은 Population의 일부이지만 단순히 크기만 작은 집단이라는 의미보다 Population을 추론하기 위해 선택된 Subset이라는 의미가 중요합니다.

“Sample Mean은 Population Mean이다”

아닙니다.

Sample Mean은 Population Mean의 Estimate입니다.

“Sample Size가 크면 반드시 Representative하다”

아닙니다.

Large Sample도 Sampling Bias가 존재할 수 있습니다.

“Random Sampling이면 Sample과 Population의 값이 완전히 같아야 한다”

아닙니다.

Random Sampling에서도 자연스러운 Sampling Variability가 발생합니다.

“Sample이 다르면 결과가 달라지므로 Statistics는 신뢰할 수 없다”

그렇지 않습니다.

Statistics는 이러한 Sample-to-Sample Variation을 Standard Error와 Confidence Interval 같은 방법으로 정량화합니다.

“Population 전체를 조사하지 않았으므로 아무 결론도 내릴 수 없다”

아닙니다.

적절한 Sampling과 Statistical Inference를 이용하면 Sample에서 Population Parameter에 대한 정보를 얻을 수 있습니다.

“SAS가 분석을 완료하면 Sample이 Population을 대표한다는 것도 검증된 것이다”

아닙니다.

SAS는 주어진 Sample을 계산하지만 Sampling Design과 Representativeness는 별도로 판단해야 합니다.

“Sample Size 30이면 모든 분석에 충분하다”

아닙니다.

30은 특정 Central Limit Theorem 설명에서 흔히 언급되는 Rule of Thumb일 뿐 모든 Statistical Situation에 적용되는 절대 기준이 아닙니다.

Population과 Sample의 전체 구조

지금까지의 내용을 하나의 구조로 정리하면 다음과 같습니다.

Population

전체 관심 대상

Unknown Parameters

μ, σ², σ 등

Sampling

Sample

실제로 관찰한 Data

Statistics

x̄, s², s 등

Standard Error

Confidence Interval

Hypothesis Test

Regression Estimate

Statistical Inference

Population Parameter / Relationship에 대한 결론

첨부 교재에서도 Sample Statistic을 사용해 Population Parameter를 Approximate하며, Inferential Statistics의 목적을 Sample을 이용한 Population Parameter 추정과 Population 특성에 대한 Probability Statement로 설명합니다.

왜 Population과 Sample을 먼저 이해해야 할까?

앞으로 다루게 될 많은 개념은 모두 이 구조에서 출발합니다.

Random Sampling

Sample을 어떻게 선택할 것인가?

Parameter와 Statistic

Population과 Sample의 숫자는 어떻게 다른가?

Confidence Interval

Population Parameter의 불확실성을 어떻게 표현할 것인가?

Hypothesis Testing

Sample Evidence로 Population Hypothesis를 어떻게 평가할 것인가?

Regression

Sample Relationship으로 Population Relationship을 어떻게 추정할 것인가?

즉 Population과 Sample을 이해하지 않고 개별 Formula만 외우면 통계학의 전체 구조를 이해하기 어렵습니다.

핵심 정리

Population은 연구자가 관심을 가지고 결론을 내리고자 하는 전체 집단입니다.

Sample은 그 Population에서 실제 Data를 수집하기 위해 선택한 일부 Subset입니다.

첨부 교재에서는 Population을 관심 Group의 전체 구성원으로, Sample을 Population에서 추출한 일부 집합으로 설명하고 있으며 Sample이 Population을 Representative한다는 전제를 중요하게 둡니다.

Sample을 사용하는 이유는 Population 전체를 항상 측정하기 어렵기 때문입니다.

따라서 실제 Statistical Analysis는 다음 구조를 가집니다.

Population

Unknown Parameter

Random / Representative Sample

Sample Statistic 계산

Sampling Uncertainty 평가

Statistical Inference

Population Parameter에 대한 결론

또한 Sample에서 계산된 Mean, Variance, Standard Deviation 같은 Statistics는 Population의 대응 Parameter를 추정하는 데 사용됩니다. 첨부 교재에서도 Sample Statistics가 Population Parameters를 Approximate한다고 설명합니다.

가장 중요한 점은 Sample Size만으로 좋은 Sample이 결정되지 않는다는 것입니다.

Sample이 Population을 제대로 Representative하지 못한다면 아무리 많은 Observation을 수집해도 Population에 대한 결론이 왜곡될 수 있습니다.

Statistical Inference의 출발점은 많은 Data를 모으는 것이 아니라, 명확하게 정의된 Population에서 적절한 Sample을 얻는 것입니다.

그리고 그 Sample에서 얻은 Statistic과 Sampling Uncertainty를 이용해 다시 Population에 대한 결론으로 확장하는 것이 Statistics의 기본 원리입니다.

함께 읽으면 좋은 글

  • Random Sampling의 중요성: 대표성 없는 표본이 통계 결과를 왜곡하는 이유
  • Parameter와 Statistic의 차이: 모집단 특성을 표본 통계량으로 추정하는 방식
  • Descriptive와 Inferential Statistics의 차이: 표본 분석에서 모집단 추론으로 확장하는 과정
  • Confidence Interval의 의미: 단일 추정값보다 범위 추정이 중요한 이유
  • Null Hypothesis와 Alternative Hypothesis의 구조: 통계적 가설검정이 시작되는 방식

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Introduction to Statistics
  • Fundamental Statistical Concepts
  • Populations and Samples
  • Parameters and Statistics
  • Descriptive and Inferential Statistics
  • Confidence Intervals for the Mean
  • Simple Linear Regression

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.