Random Sampling의 중요성: 대표성 없는 표본이 통계 결과를 왜곡하는 이유
통계분석에서 Sample Size가 크면 결과도 자동으로 신뢰할 수 있다고 생각하기 쉽습니다.
하지만 1,000명을 조사했더라도 특정 특성을 가진 사람들만 집중적으로 선택했다면 그 Sample은 전체 Population을 제대로 대표하지 못할 수 있습니다.
반대로 Sample Size가 상대적으로 작더라도 Population에서 적절한 방법으로 Random하게 선택했다면 Population의 특성을 추론하는 데 더 유용할 수 있습니다.
이 차이를 이해하려면 Random Sampling과 Representativeness의 관계를 알아야 합니다.
Random Sampling의 핵심 목적은 단순히 대상을 무작위로 고르는 데 있는 것이 아니라, 특정 집단이 체계적으로 과대·과소 선택되는 위험을 줄여 Sample이 Population을 대표할 가능성을 높이는 데 있습니다.
첨부 교재에서도 Simple Random Sampling을 Population의 각 구성원이 선택될 동일한 확률을 가지는 Sampling Method로 설명하고 있으며, Random Sampling이 Sample의 Representativeness를 확보하는 데 도움을 줄 수 있다고 설명합니다.
Random Sampling이란 무엇인가?
Random Sampling은 Population에서 Sample을 선택할 때 Random Mechanism을 사용하는 방법입니다.
가장 기본적인 형태가 Simple Random Sampling입니다.
Simple Random Sampling에서는 Population의 모든 구성원이 Sample에 포함될 동일한 기회를 갖습니다.
예를 들어 Population에 학생 1,000명이 있다고 가정해보겠습니다.
그중 100명을 조사하려면:
Population
1,000 Students
↓
각 학생에게 동일한 Selection Chance 부여
↓
Random Selection
↓
Sample
100 Students
형태가 됩니다.
첨부 교재에서도 Simple Random Sample에서는 Population의 모든 구성원이 Sample에 포함될 동일한 Chance를 갖는다고 설명합니다.
Random Sampling과 Random Assignment는 같은 것일까?
아닙니다.
이 둘은 통계에서 자주 혼동되는 개념입니다.
Random Sampling
Population
↓
누구를 Sample에 포함할 것인가?
와 관련됩니다.
Random Assignment
이미 연구에 참여한 사람들을:
Treatment A
Treatment B
등으로 어떻게 배정할 것인가와 관련됩니다.
즉:
Random Sampling
↓
Representativeness와 Population Generalization
Random Assignment
↓
Treatment Group 간 비교와 Causal Interpretation
에 더 직접적으로 연결됩니다.
Random이라는 단어는 같지만 Sampling과 Assignment가 해결하려는 문제는 서로 다릅니다.
왜 Population에서 아무나 일부 선택하면 안 될까?
예를 들어 학교 전체 학생의 평균 SAT Score를 알고 싶다고 가정해보겠습니다.
Population은:
학교 전체 학생
입니다.
그런데 조사하기 편하다는 이유로 통계 수업을 듣는 한 Class의 학생만 조사한다면 어떻게 될까요?
Sample은 쉽게 얻을 수 있습니다.
하지만 해당 Class의 학생들이 학교 전체와 같은 특성을 가지고 있다는 보장은 없습니다.
예를 들어:
- 학년이 다를 수 있고
- 학업 수준이 다를 수 있으며
- 선택 과목 특성 때문에 특정 학생이 더 많이 포함될 수 있습니다.
따라서 계산된 Sample Mean이 정확하더라도 Population Mean을 제대로 추정하지 못할 수 있습니다.
첨부 교재에서도 Ms. Chao의 Class처럼 쉽게 접근할 수 있는 학생만 선택하는 것을 Convenience Sampling이라고 설명하며, 이러한 방식은 Biased Sample을 만들 수 있다고 설명합니다.
Convenience Sampling이란 무엇인가?
Convenience Sampling은 연구자가 쉽게 접근할 수 있는 대상을 중심으로 Sample을 구성하는 방식입니다.
예를 들어:
- 회사 앞을 지나가는 사람만 조사
- 한 Class 학생만 조사
- 특정 Website 방문자만 조사
- 자신의 지인만 대상으로 Survey
- 한 Hospital Patient만으로 전국 Patient 추론
같은 방식입니다.
이 방법은 빠르고 비용이 적게 들 수 있습니다.
하지만 Sample Selection이 Population 전체에서 Random하게 이루어지지 않기 때문에 특정 특성이 과도하게 포함될 가능성이 있습니다.
Convenience Sample이 항상 틀린 것일까?
그렇게 단정할 수는 없습니다.
Exploratory Study나 Pilot Study처럼 제한된 목적에서는 Convenience Sample을 사용할 수 있습니다.
문제는 그 Sample에서 얻은 결과를 원래 Sample이 대표하지 못하는 더 넓은 Population까지 일반화할 때 발생합니다.
예를 들어 한 대학 학생 100명을 조사해서:
“이 대학 학생들의 경향”
을 설명하는 것과
“한국 성인 전체의 경향”
을 설명하는 것은 전혀 다른 수준의 주장입니다.
따라서 Sampling Method뿐 아니라 결론을 어디까지 확장하려는지가 중요합니다.
Biased Sample이란 무엇인가?
Biased Sample은 Population의 특성을 체계적으로 잘못 반영하는 Sample입니다.
첨부 교재에서는 Bias가 있는 Sample을 추출된 Population을 Representative하지 못하는 Sample이라고 설명합니다.
예를 들어 실제 Population이:
Group A
50%
Group B
50%
인데 Sample은:
Group A
90%
Group B
10%
로 구성되었다고 가정해보겠습니다.
만약 Group A와 Group B의 Outcome이 다르다면 Sample Mean도 Population Mean과 체계적으로 달라질 수 있습니다.
Bias와 단순한 우연의 차이는 무엇일까?
Random Sample에서도 Population과 완전히 동일한 비율이 나오지는 않습니다.
예를 들어 Population에서 Male과 Female이 정확히 50:50이라도 100명을 Random Sampling했을 때:
48:52
또는
55:45
가 될 수 있습니다.
이것은 자연스러운 Sampling Variability입니다.
반면 Sampling Method 자체 때문에 항상 Male이 많이 선택되는 구조라면 Sampling Bias가 될 수 있습니다.
즉:
Sampling Variability
Random Chance 때문에 발생
Sampling Bias
Selection Process 때문에 특정 방향으로 발생
입니다.
통계적 불확실성과 체계적인 왜곡은 같은 문제가 아닙니다.
Sample Size를 늘리면 Sampling Variability는 줄어들까?
일반적으로 다른 조건이 비슷하다면 그렇습니다.
Sample Size가 커지면 Sample Statistic이 Population Parameter 주변에서 더 안정적으로 나타나는 경향이 있습니다.
예를 들어 Population에서:
n = 20
을 뽑는 경우보다
n = 2,000
을 뽑는 경우 Sample Mean의 Sampling Variability가 작아질 가능성이 높습니다.
이는 Standard Error와 연결됩니다.
하지만 여기서 반드시 구분해야 하는 부분이 있습니다.
Sample Size를 늘리면 Sampling Bias도 없어질까?
반드시 그렇지 않습니다.
이것이 Random Sampling을 이해할 때 가장 중요한 부분 중 하나입니다.
예를 들어 특정 Online Community 사용자만 조사한다고 가정해보겠습니다.
100명 조사
↓
Bias 가능
그렇다면 100,000명 조사하면 문제가 해결될까요?
해당 Community를 이용하지 않는 사람들은 여전히 Sample에서 제외됩니다.
즉:
작은 Biased Sample
↓
문제 있음
매우 큰 Biased Sample
↓
여전히 문제 있음
입니다.
많은 Data는 Random Error를 줄이는 데 도움을 줄 수 있지만 잘못된 Sampling Design을 자동으로 수정하지는 못합니다.
큰 Sample이 오히려 잘못된 결론에 확신을 줄 수도 있다
Bias가 있는 Sample에서 n이 매우 크면 Estimate의 Standard Error가 작아질 수 있습니다.
그러면 Result는 매우 정밀해 보일 수 있습니다.
하지만 그 Estimate가 Target Population의 True Value에서 체계적으로 벗어나 있다면 우리는 잘못된 값을 매우 정밀하게 추정하는 상황이 될 수 있습니다.
개념적으로:
Biased Sampling
↓
Wrong Center
Large Sample
↓
Small Random Error
↓
매우 정밀하지만 잘못된 Estimate
가 가능합니다.
따라서 Precision과 Accuracy를 구분해야 합니다.
Precision과 Accuracy는 어떻게 다를까?
Precision
반복해서 측정했을 때 결과가 얼마나 안정적인가?
Accuracy
추정값이 실제 Target Value에 얼마나 가까운가?
로 생각할 수 있습니다.
큰 Sample은 Precision을 높이는 데 도움을 줄 수 있습니다.
하지만 Sampling Bias가 존재하면 Accuracy가 떨어질 수 있습니다.
즉:
Large N
↓
High Precision 가능
하지만
Representative Sampling
이 없다면
High Accuracy를 보장하지 않음
입니다.
Representative Sample이란 무엇인가?
Representative Sample은 Population의 중요한 특성을 합리적으로 반영하는 Sample입니다.
첨부 교재에서는 Course의 전제로 drawn sample이 population을 representative한다고 명시하고 있습니다.
예를 들어 Population의 특성이:
- Gender
- Age
- Region
- Disease Severity
등에 따라 크게 다르다면 Sample이 이러한 Population Structure를 심각하게 왜곡하지 않는 것이 중요합니다.
하지만 Representative라는 것은 Population을 완벽하게 축소 복사했다는 의미는 아닙니다.
Random Sampling은 Representative Sample을 보장할까?
완벽하게 보장하지는 않습니다.
Random Sampling에서도 Chance Variation이 존재하기 때문입니다.
예를 들어 Population의 특정 Category가 10%라고 하더라도 작은 Random Sample에서는:
5%
또는
15%
가 포함될 수 있습니다.
따라서 Random Sample은 Population과 정확히 동일한 구성비를 보장하지 않습니다.
하지만 Selection 과정에서 특정 구성원을 의도적으로 선호하는 Mechanism을 줄이는 데 도움을 줍니다.
첨부 교재에서도 Random Sampling은 Sample이 Population을 Representative하도록 도울 수 있다고 표현합니다.
Equal Probability가 왜 중요한가?
Simple Random Sampling에서는 Population의 모든 구성원이 Sample에 포함될 동일한 Probability를 가집니다.
예를 들어 학생 1,000명에서 100명을 Simple Random Sampling하면 각 학생이 선택될 기회가 동일한 구조입니다.
반대로:
성적 상위 학생은 선택될 확률 50%
성적 하위 학생은 선택될 확률 5%
라면 Sample은 높은 성적 학생 쪽으로 Bias될 수 있습니다.
따라서 Equal Selection Probability는 특정 특성을 가진 대상이 Systematically Favor되는 것을 줄이는 중요한 원리입니다.
Simple Random Sample은 어떻게 뽑을까?
가장 단순한 방법은 Population의 모든 구성원에게 Identifier를 부여하고 Random Number Mechanism으로 Sample을 선택하는 것입니다.
예를 들어:
Population
1번 ~ 1,000번
↓
Random Number 생성
↓
100개 Identifier 선택
↓
Sample
100명
형태입니다.
수작업으로 이름을 보고 선택하는 것과 다르게 Random Number가 Selection을 결정합니다.
사람에게 “무작위로 골라보라”고 하면 Random Sampling일까?
반드시 그렇지 않습니다.
사람은 무의식적으로 특정 Pattern을 선호할 수 있습니다.
예를 들어 목록에서:
- 눈에 잘 띄는 사람
- 첫 페이지 사람
- 이름이 익숙한 사람
- 접근하기 쉬운 사람
을 더 자주 선택할 수 있습니다.
따라서 Statistical Random Sampling에서는 일반적으로 Random Number Generator 같은 객관적인 Randomization Mechanism을 사용합니다.
SAS Enterprise Guide에서도 Random Sample을 만들 수 있을까?
첨부 교재 Appendix에서는 SAS Enterprise Guide에서 Random Sample Task를 사용하여 Dataset의 일부를 Simple Random Sampling하는 과정을 보여줍니다.
예제에서는 TITANIC_FORMATTED Dataset에서 10% Simple Random Sample을 선택하고 TITANIC_SAMPLE이라는 새로운 Dataset을 생성합니다.
구조는 다음과 같습니다.
TITANIC_FORMATTED
↓
Data → Random Sample
↓
Sample Size = 10%
↓
Simple Random Sampling
↓
TITANIC_SAMPLE
SAS의 Random Seed란 무엇인가?
Random Sampling에서 중요한 개념 중 하나가 Random Seed입니다.
Computer는 Pseudorandom Number Generator를 이용해 Random Number Sequence를 생성할 수 있습니다.
Seed는 그 Sequence를 시작하는 기준값으로 사용할 수 있습니다.
같은 Sampling Algorithm과 같은 Dataset에서 동일한 Seed를 사용하면 동일한 Random Sample을 재현할 수 있는 환경을 만들 수 있습니다.
첨부 교재에서도 명시적인 Seed를 제공하지 않으면 Sample을 재현할 수 없으며, SAS Enterprise Guide가 날짜와 시간을 기반으로 Seed를 사용할 수 있으므로 명시적인 Seed를 포함하는 것을 권장합니다.
왜 Random Sample을 재현해야 할까?
처음에는 Random Sampling이라면 매번 다른 Sample이 나오는 것이 더 자연스럽다고 생각할 수 있습니다.
하지만 분석 업무에서는 누군가 동일한 Process를 다시 실행했을 때 같은 Sample을 확인해야 하는 경우가 있습니다.
예를 들어:
Analyst A
Random Sample 생성
↓
Model 개발
↓
Result 보고
몇 주 후:
Analyst B
동일 분석 검증
을 한다고 가정해보겠습니다.
Random Seed를 기록하지 않았다면 다른 Sample이 선택되어 결과가 달라질 수 있습니다.
따라서 재현 가능한 분석에서는:
- Input Dataset
- Sampling Rate
- Sampling Method
- Random Seed
같은 정보를 함께 기록하는 것이 유용합니다.
같은 Seed를 사용하면 항상 같은 Sample이 나올까?
동일한 Dataset과 동일한 Sampling Procedure 등 필요한 조건이 같다는 전제에서 재현성을 높이는 데 Seed가 사용됩니다.
하지만 Input Dataset 자체가 바뀌거나 Sampling 조건이 달라진다면 동일한 Seed만으로 동일한 Observation이 선택된다고 단정할 수 없습니다.
즉 Seed는 전체 Workflow의 한 요소입니다.
Reproducibility는 Seed 하나가 아니라 Data + Sampling Rule + Seed + Execution 조건을 함께 관리하는 문제입니다.
첨부 교재의 Titanic Example에서는 무엇을 보여줄까?
교재에서는 Titanic Data에서 10%를 Random Sampling합니다.
결과에는 다음과 같은 정보가 표시됩니다.
- Selection Method = Simple Random Sampling
- Input Data Set = TITANIC_FORMATTED
- Random Number Seed = 27513
- Sampling Rate = 0.1
- Sample Size = 131
- Selection Probability
- Sampling Weight
- Output Data Set = TITANIC_SAMPLE
이 예제는 Random Sampling이 단순히 “10% Data를 삭제하고 남긴다”는 의미가 아니라 명시된 확률적 Selection Method로 Observation을 선택하는 과정이라는 점을 보여줍니다.
Random하게 10%를 뽑는 것과 앞의 10%를 가져오는 것은 같은가?
전혀 다릅니다.
Dataset에 1,000 Rows가 있다고 가정해보겠습니다.
방법 A
첫 100 Rows 선택
방법 B
1,000 Rows 전체에서 Random하게 100 Rows 선택
두 방법 모두 Sample Size는 100입니다.
하지만 Dataset이 특정 순서로 정렬되어 있다면 첫 100 Rows에는 Bias가 생길 수 있습니다.
예를 들어 Dataset이:
Age 순서
Site 순서
Score 순서
Date 순서
로 정렬되어 있다면 첫 100 Rows는 전체 Population과 매우 다른 특성을 가질 수 있습니다.
Random Sampling은 이와 같은 Order-dependent Selection 위험을 줄이는 데 도움을 줍니다.
Random Sampling 전에 Population 범위를 먼저 정해야 하는 이유
Random하게 뽑는다고 해서 Population Definition 문제가 자동으로 해결되지는 않습니다.
예를 들어 Target Population은:
한국의 모든 성인
인데 Sampling Frame은:
서울 거주자 명단
뿐이라고 가정해보겠습니다.
서울 거주자 중에서 아무리 완벽하게 Random Sampling하더라도 다른 지역 Population은 처음부터 Sampling 대상에 포함되지 않았습니다.
따라서 먼저:
Target Population
↓
무엇인가?
그 다음:
Sampling Frame
↓
Population을 얼마나 포함하는가?
를 확인해야 합니다.
Sampling Frame이란 무엇인가?
Sampling Frame은 실제 Sample을 선택할 때 사용하는 Population Member의 목록 또는 접근 가능한 대상 집합으로 이해할 수 있습니다.
예를 들어:
Target Population
=
회사 고객 전체
Sampling Frame
=
현재 Customer Database에 등록된 고객
일 수 있습니다.
만약 Database에서 오래된 고객이나 특정 유형의 고객이 누락되어 있다면 Sampling Frame 자체에서 Coverage Problem이 발생할 수 있습니다.
Random Sampling은 Sampling Frame 안에서의 Random Selection을 개선할 수 있지만 Frame 밖에 빠진 Population Member를 자동으로 포함하지는 못합니다.
Coverage Bias란 무엇인가?
Target Population의 일부가 Sampling Frame에서 빠져 있으면 Coverage Bias가 발생할 수 있습니다.
예를 들어 전화 Survey에서 Mobile Phone User만 Sampling할 수 있고 다른 Communication Group은 제외된다고 가정해보겠습니다.
제외된 Group의 특성이 응답 Group과 다르면 Population Estimate가 왜곡될 수 있습니다.
즉 좋은 Random Sampling을 위해서는:
좋은 Sampling Frame
Random Selection
이 함께 필요합니다.
Nonresponse도 Random Sample을 왜곡할 수 있을까?
가능합니다.
처음에는 1,000명을 Random하게 선택했다고 가정해보겠습니다.
하지만 실제 Survey에는 200명만 응답했습니다.
만약 응답하지 않은 800명과 응답한 200명의 특성이 다르다면 최종 분석 Sample은 원래의 Random Sample과 다른 특성을 가질 수 있습니다.
전체 구조는:
Randomly Selected Sample
1,000명
↓
Nonresponse
↓
Final Responders
200명
입니다.
Random Sampling을 했다는 사실만으로 Final Analysis Sample의 Representativeness가 완전히 보장되지는 않습니다.
Voluntary Response Sample은 왜 위험할 수 있을까?
온라인 Poll처럼 참여하고 싶은 사람이 스스로 응답하는 방식을 생각해보겠습니다.
특정 Issue에 대해 매우 강한 의견을 가진 사람이 더 적극적으로 참여할 수 있습니다.
그러면 중간 정도의 의견을 가진 사람은 적게 포함될 수 있습니다.
즉 Selection Probability가 Random Mechanism이 아니라 Participant의 Self-Selection에 영향을 받습니다.
이런 구조는 Population Opinion을 왜곡할 수 있습니다.
Survivorship Bias도 Sampling 문제와 연결될까?
넓게 보면 관찰 가능한 대상이 이미 특정 Selection Process를 통과했다는 점에서 Sample Representativeness 문제와 연결할 수 있습니다.
예를 들어 성공한 기업만 분석하면서 실패한 기업은 Data에 포함하지 않는다면:
“성공을 만드는 요인”
을 분석할 때 중요한 비교 대상이 빠질 수 있습니다.
다만 이것은 Simple Random Sampling과 동일한 개념은 아니며, 누가 분석 Dataset에 들어오는가를 확인해야 한다는 더 넓은 Selection 문제로 이해하는 것이 좋습니다.
Random Sampling은 Data Quality 문제도 해결해줄까?
아닙니다.
Random Sampling은 Sample Selection 문제입니다.
예를 들어 Random하게 500명을 잘 선택했다고 하더라도:
- Age를 잘못 입력
- Measurement Device 오류
- Duplicate Record
- 잘못된 Unit
- Missing Data
가 존재하면 Statistical Analysis가 왜곡될 수 있습니다.
따라서 좋은 분석에는:
Sampling Quality
Measurement Quality
Data Quality
가 모두 필요합니다.
첨부 교재에서도 Random Sample을 선택한 뒤 Inferential Statistics를 수행하기 전에 Data Error, unusual shape, extreme value 등을 먼저 확인해야 한다고 설명합니다.
Random Sample을 얻은 뒤 바로 Hypothesis Test를 하면 될까?
바로 Test부터 수행하는 것은 좋은 순서가 아닐 수 있습니다.
첨부 교재의 흐름은 다음과 같습니다.
Random Sample 선택
↓
Descriptive Statistics
↓
Unusual Value 확인
Spread 확인
Shape 확인
Central Tendency 확인
↓
Inferential Statistics
입니다.
즉 Sampling이 적절해도 실제 Data를 먼저 탐색해야 합니다.
왜 Extreme Value를 확인해야 할까?
Random Sampling 과정에서 실제로 Population에 존재하는 Extreme Observation이 Sample에 포함될 수 있습니다.
또는 Data Entry Error일 수도 있습니다.
예를 들어 Income Data가:
40
45
50
55
5000
이라면 5000이 실제 값인지 오류인지 확인해야 합니다.
이를 확인하지 않으면 Mean과 Standard Deviation이 크게 영향을 받을 수 있습니다.
따라서 Random Sample은 “깨끗한 Sample”이라는 의미가 아닙니다.
Sample은 Random하면서 Representative해야 할까?
첨부 교재의 Multiple Answer Poll에서는 Sample이 어떤 특성을 가져야 하는지 묻고 있으며, 교재 설명에서는 Random Sampling과 Representativeness를 핵심으로 다룹니다.
여기서 중요한 점은:
Random
은 Sample Selection 방법의 성격이고,
Representative
는 Sample이 Population을 얼마나 적절히 반영하는가에 관한 성격이라는 것입니다.
둘은 서로 연결되어 있지만 같은 단어는 아닙니다.
Sample이 Normal이어야 Representative한 것일까?
아닙니다.
Population 자체가 Skewed Distribution을 가진다면 Representative Sample 역시 어느 정도 Skewed Pattern을 보일 수 있습니다.
예를 들어 Income Population이 Right-Skewed되어 있는데 Sample을 억지로 Normal Distribution처럼 구성한다면 오히려 Population을 왜곡할 수 있습니다.
즉:
Representative
≠
Normal Distribution
입니다.
Population의 실제 특성을 합리적으로 반영하는 것이 중요합니다.
Random Sampling과 Normal Distribution은 직접 같은 개념이 아니다
Random Sampling은 Observation을 어떻게 선택하는지에 관한 개념입니다.
Normal Distribution은 Variable의 Distribution Shape에 관한 개념입니다.
따라서 Random Sample을 뽑았다고 해서 Raw Data가 자동으로 Normal Distribution을 따라야 하는 것은 아닙니다.
이 두 개념은 이후 Central Limit Theorem을 이해할 때도 구분해야 합니다.
Central Limit Theorem은 Random Sampling과 어떻게 연결될까?
Inferential Statistics에서는 Sample Mean의 Sampling Distribution이 중요합니다.
동일한 Population에서 Random Sample을 반복적으로 추출하고 각 Sample의 Mean을 계산한다고 생각해보겠습니다.
Random Sample 1
↓
Mean 1
Random Sample 2
↓
Mean 2
Random Sample 3
↓
Mean 3
…
이러한 Sample Means의 Distribution을 이용하여 Standard Error와 Confidence Interval, Hypothesis Test를 이해할 수 있습니다.
따라서 Random Sampling은 Inferential Statistics의 확률적 기반과도 연결됩니다.
Random Sample을 반복하면 같은 Mean이 나올까?
아닙니다.
Sample 구성원이 매번 달라질 수 있으므로 Sample Mean도 달라집니다.
예를 들어:
Sample A Mean = 1192
Sample B Mean = 1210
Sample C Mean = 1187
처럼 나올 수 있습니다.
이 차이는 실패가 아니라 자연스러운 Sampling Variability입니다.
Statistics는 이러한 Variation이 어느 정도 발생할지를 Model로 다룹니다.
Random Sample마다 Result가 달라지는데 어떻게 Population을 추론할까?
바로 이 때문에 Standard Error와 Confidence Interval이 필요합니다.
Sample Statistic 하나만 계산하고 끝내는 것이 아니라 그 Statistic이 Sampling 과정에서 얼마나 변할 수 있는지를 평가합니다.
전체적으로:
Random Sampling
↓
Sample Statistic
↓
Sampling Distribution
↓
Standard Error
↓
Confidence Interval / Hypothesis Test
↓
Population Inference
로 연결됩니다.
Random Sampling은 단순한 데이터 추출 기술이 아니라 Inferential Statistics가 성립하는 확률적 구조의 출발점입니다.
Sampling Probability란 무엇인가?
Simple Random Sampling에서는 각 Population Member가 선택될 Probability를 정의할 수 있습니다.
예를 들어 Population 1,000명 중 100명을 선택한다면 각 구성원이 Sample에 포함될 Probability가 동일한 구조를 설계할 수 있습니다.
첨부 교재의 Titanic Example에서도 Output에 Selection Probability가 표시됩니다.
이처럼 Sampling은 단순히 선택된 Observation만 보는 것이 아니라 어떤 확률 구조로 선택되었는가를 함께 이해할 수 있습니다.
Sampling Weight란 무엇일까?
첨부 교재의 Random Sample Output에는 Sampling Weight도 표시됩니다.
Sampling Weight는 Sampling Design에서 Observation이 Population을 얼마나 대표하는지를 반영하는 데 사용될 수 있는 개념입니다.
예를 들어 어떤 Observation의 Selection Probability가 작다면 더 많은 Population Members를 대표하는 Weight를 가질 수 있습니다.
다만 복잡한 Survey Sampling에서 Weight를 어떻게 계산하고 분석에 적용하는지는 Simple Random Sampling보다 확장된 주제입니다.
Simple Random Sampling만이 Random Sampling 방법일까?
아닙니다.
실제 조사에서는 Population Structure와 비용 등을 고려해 다양한 Sampling Design을 사용할 수 있습니다.
예를 들어:
- Stratified Sampling
- Cluster Sampling
- Systematic Sampling
- Multistage Sampling
등이 있습니다.
다만 첨부 교재에서 Fundamental Statistical Concept로 강조하는 기본 원리는 Simple Random Sampling이며, 각 Population Member가 동일한 Selection Chance를 갖는 구조를 설명합니다.
Stratified Sampling은 왜 사용할까?
예를 들어 Population이 지역별로 크게 다르다고 가정해보겠습니다.
Population:
- Seoul 50%
- Busan 20%
- Other Regions 30%
Random Sample이 우연히 특정 지역에 치우칠 가능성을 관리하거나 각 Subgroup에서 충분한 Sample을 확보하기 위해 Population을 Stratum으로 나누어 Sampling할 수 있습니다.
즉:
Population
↓
Strata 구분
↓
각 Stratum에서 Sample 선택
↓
전체 Sample
형태입니다.
이는 Simple Random Sampling보다 Sampling Design을 확장한 개념입니다.
Sampling Design이 복잡해지면 일반 분석을 그대로 써도 될까?
항상 그렇지는 않습니다.
복잡한 Survey Design에서는:
- Sampling Weight
- Stratification
- Cluster
등을 Statistical Analysis에 반영해야 할 수 있습니다.
즉 Sample을 어떻게 뽑았는지가 단순 Data Collection 정보에서 끝나는 것이 아니라 분산 추정과 Inference 자체에 영향을 줄 수 있습니다.
이 글에서는 Simple Random Sampling의 기본 원리에 초점을 두지만, 실제 Survey Data에서는 Sampling Design을 반드시 확인해야 합니다.
Random Sampling이 현실적으로 불가능한 경우도 있을까?
많습니다.
예를 들어 Rare Disease Study에서 전 세계 Patient 전체의 Sampling Frame을 만드는 것은 현실적으로 어려울 수 있습니다.
또 Clinical Trial은 일반 Population에서 Simple Random Sample을 추출하는 구조와 다를 수 있습니다.
Eligibility Criteria, Site Selection, Consent 등이 있기 때문입니다.
따라서 모든 연구가 Simple Random Sampling을 사용하는 것은 아닙니다.
이 경우 중요한 것은 Sampling Limitation을 이해하고 Population Generalization의 범위를 적절히 제한하는 것입니다.
Clinical Trial에서 Randomization과 Random Sampling을 혼동하면 안 되는 이유
Clinical Trial에서는 Treatment Randomization을 자주 사용합니다.
하지만 Trial Participant 자체가 Target Disease Population에서 Simple Random Sample로 선택된 것은 아닐 수 있습니다.
즉:
Treatment Assignment
Random
이라고 해서
Population Sampling
까지 Random이라는 의미는 아닙니다.
따라서 Randomized Trial이라고 해도 External Generalizability는 별도로 검토해야 합니다.
Observational Study에서도 Random Sampling은 중요한가?
가능하다면 Population Representation에 중요할 수 있습니다.
Observational Study에서는 Treatment를 Randomly Assign하지 않더라도 Population에서 Sample을 어떻게 선택했는지가 Population Inference에 영향을 줍니다.
즉:
Random Sampling
과
Randomized Experiment
는 서로 다른 차원입니다.
Sampling Bias가 Regression에도 영향을 줄까?
그렇습니다.
Sampling Bias는 평균 추정뿐 아니라 Variable Relationship에도 영향을 줄 수 있습니다.
예를 들어 특정 Age Group만 Sample에 많이 포함된다면 Age와 Outcome의 Relationship이 Population 전체와 다르게 보일 수 있습니다.
또 특정 Outcome을 가진 대상만 Data에 들어온다면 Predictor와 Response Association 자체가 왜곡될 수 있습니다.
따라서 Regression에서도 Sample Selection Mechanism을 고려해야 합니다.
Sampling Bias가 ANOVA에도 영향을 줄까?
마찬가지입니다.
예를 들어 Treatment Group별 Outcome을 비교하지만 Sample이 특정 Site나 특정 Patient 특성에 크게 치우쳐 있다면 관찰된 Group Difference를 더 넓은 Population에 그대로 Generalize하기 어려울 수 있습니다.
SAS가 ANOVA F Statistic과 p-value를 정확하게 계산해도 Sample 자체의 Selection Bias를 자동으로 제거하지는 않습니다.
Logistic Regression도 Sample 대표성이 필요할까?
필요합니다.
예를 들어 Disease Risk를 예측하는 Logistic Regression Model을 만들었는데 Sample이 Severe Patient 위주라면 General Population에서 Model Performance가 달라질 수 있습니다.
따라서:
Model Accuracy in Sample
과
Population Generalizability
를 구분해야 합니다.
SAS가 Random Sampling 여부를 자동으로 확인해줄까?
아닙니다.
SAS는 Dataset에 들어온 Observation이 어떤 과정으로 모집되었는지를 자동으로 알 수 없습니다.
다만 SAS Enterprise Guide의 Random Sample 기능처럼 주어진 Dataset 안에서 Random Subsample을 만들 수는 있습니다.
하지만 이미 원래 Dataset 자체가 Biased Population Sample이라면 그 Dataset에서 Random 10%를 다시 뽑아도 원래 Sampling Bias가 사라지는 것은 아닙니다.
Biased Source Dataset에서 Random Subsample을 만드는 것은 Source Dataset의 대표성 문제를 해결하지 못합니다.
이 차이를 예로 들어보자
Target Population:
한국 성인 전체
↓
원래 Dataset:
서울의 한 Fitness Center 회원만 포함
↓
그 Dataset에서 SAS로 10% Random Sample
이렇게 하면 Fitness Center 회원 Dataset 내부에서는 Random Sample일 수 있습니다.
하지만:
한국 성인 전체
에 대한 Representative Sample이라고 할 수 있는지는 별개의 문제입니다.
즉 Sampling의 Randomness는 어떤 Population 또는 Sampling Frame에서 Random했는가와 함께 봐야 합니다.
Random Sample 생성 전에 Source Dataset을 확인해야 하는 이유
다음 사항을 먼저 확인해야 합니다.
- Source Dataset은 어떤 Population에서 왔는가?
- Inclusion / Exclusion Rule은 무엇인가?
- Duplicate가 있는가?
- 각 Row는 동일한 Sampling Unit인가?
- Missing Record가 있는가?
- 이미 Filter가 적용되었는가?
이 정보를 확인하지 않고 Random Sample만 생성하면 의도한 Population과 다른 Sample을 만들 수 있습니다.
Sampling Unit이란 무엇인가?
Sampling Unit은 실제 Selection의 대상이 되는 기본 단위입니다.
예를 들어:
학생 연구
↓
Student
가 Sampling Unit일 수 있습니다.
하지만 Household Survey에서는:
Household
가 먼저 선택되고 그 안에서 Individual을 선택할 수도 있습니다.
따라서 Dataset Row와 Sampling Unit이 항상 동일하다고 단정해서는 안 됩니다.
Duplicate가 Random Sampling에 영향을 줄 수 있을까?
가능합니다.
예를 들어 한 Patient가 Dataset에 두 번 들어가 있다면 Random Sampling 과정에서 그 Patient가 선택될 기회가 다른 Patient보다 커질 수 있습니다.
즉 Sampling Frame에 Duplicate가 있으면 Equal Selection Probability라는 의도와 실제 대상의 Selection Probability가 달라질 수 있습니다.
따라서 Sampling 전에 Source Data Quality를 확인해야 합니다.
Sample with Replacement와 without Replacement는 무엇이 다를까?
Simple Random Sampling에서도 하나의 대상을 선택한 뒤 다시 Population Pool에 넣는지에 따라 구조가 달라질 수 있습니다.
Without Replacement
한 번 선택된 Unit은 같은 Sample에서 다시 선택되지 않음
With Replacement
선택된 Unit이 다시 선택될 가능성이 있음
첨부 교재에서도 Random Sample with and without Replacement에 대한 내용은 Appendix를 참고하도록 안내합니다.
일반적인 사람 Survey에서는 같은 사람을 Sample에 여러 번 포함하는 것이 목적과 맞지 않는 경우가 많으므로 Sampling Design을 확인해야 합니다.
Random Seed를 보고 Sampling Method까지 알 수 있을까?
아닙니다.
Seed는 Random Number Sequence의 재현성과 관련됩니다.
하지만 Sampling Method 자체는 별도로 확인해야 합니다.
예를 들어:
Seed = 27513
이라고 해도:
- Simple Random Sample인지
- Stratified Sample인지
- Replacement를 허용하는지
- Sampling Rate가 얼마인지
를 Seed만으로 알 수 없습니다.
따라서 Random Sampling Documentation에는 Method와 Seed 모두 필요합니다.
Reproducible Random Sampling의 기본 구조
분석을 재현하려면 다음 항목을 남겨두는 것이 유용합니다.
Input Dataset
↓
어떤 Data에서?
Sampling Method
↓
어떤 방법으로?
Sample Size / Rate
↓
얼마나 뽑았는가?
Random Seed
↓
어떤 Random Sequence를 사용했는가?
Output Dataset
↓
어디에 저장했는가?
첨부 교재의 Titanic Example 역시 이러한 요소를 Output에 함께 보여줍니다.
Sample이 Representative한지 Result만 보고 판단할 수 있을까?
완벽하게 판단하기 어렵습니다.
Sample의 Mean, Age Distribution, Gender Distribution 등을 Population의 알려진 정보와 비교할 수는 있습니다.
하지만 알려지지 않은 특성까지 완벽하게 동일하다고 증명할 수는 없습니다.
따라서 Representativeness는:
- Sampling Design
- Population Coverage
- Nonresponse
- Data Quality
- Known Population Characteristics
등을 종합적으로 평가해야 합니다.
특정 Variable의 Distribution이 같으면 Representative한 것일까?
예를 들어 Sample과 Population에서 Gender Ratio가 모두 50:50이라고 가정해보겠습니다.
그 사실만으로 Sample 전체가 Representative하다고 결론내릴 수는 없습니다.
Age, Region, Income, Disease Severity 등 다른 특성이 크게 다를 수 있기 때문입니다.
즉 하나의 Characteristic 일치는 Representativeness의 일부 Evidence일 수 있지만 전체 보장은 아닙니다.
대표성 없는 Sample은 p-value에도 영향을 줄까?
p-value 계산 자체는 주어진 Sample과 Model을 기반으로 수행됩니다.
하지만 Sample이 Target Population을 제대로 대표하지 못하면 그 p-value에서 얻은 Inference를 Target Population 전체로 확장하는 데 문제가 생길 수 있습니다.
즉:
p-value가 정확히 계산됨
과
Population Claim이 적절함
은 서로 다른 문제입니다.
Confidence Interval도 Sampling Design에 의존할까?
그렇습니다.
Confidence Interval은 Sampling Variation을 기반으로 합니다.
Standard Formula는 특정 Sampling Assumption을 전제로 할 수 있습니다.
복잡한 Sampling Design에서는 적절한 Variance Estimation을 사용해야 할 수 있습니다.
즉 Confidence Interval도 Sample Design과 완전히 독립적인 숫자가 아닙니다.
Random Sampling과 Sample Size는 함께 봐야 한다
좋은 Statistical Inference를 위해서는 두 요소를 함께 고려해야 합니다.
Random / Representative Sampling
Bias를 관리
Adequate Sample Size
Sampling Variability와 Precision을 관리
즉:
좋은 Sampling Design
충분한 Sample Size
↓
보다 신뢰할 수 있는 Population Inference
입니다.
어느 하나만으로 충분하지 않습니다.
Sampling Bias와 Measurement Bias도 구분해야 한다
Sampling Bias
누가 Sample에 포함되는가?
에서 발생
Measurement Bias
선택된 대상에서 값을 어떻게 측정하는가?
에서 발생
예를 들어:
Random Sample을 잘 뽑았지만 Weight Scale이 항상 5kg 높게 측정한다면 Measurement Bias가 있습니다.
반대로 Weight Scale이 완벽해도 특정 체중 Group만 Sample에 포함되면 Sampling Bias가 있을 수 있습니다.
Random Sampling의 전체 구조
지금까지의 내용을 하나로 연결하면 다음과 같습니다.
Target Population
↓
Sampling Frame 확인
↓
Random Selection Mechanism
↓
Simple Random Sampling
↓
Sample
↓
Representativeness 평가
↓
Data Quality 확인
↓
Descriptive Statistics
↓
Sampling Variability 평가
↓
Inferential Statistics
↓
Population에 대한 결론
이 과정에서 한 단계라도 문제가 생기면 최종 Population Inference가 제한될 수 있습니다.
흔한 오해 정리
“Sample Size가 크면 Random Sampling은 필요 없다”
아닙니다.
Large Sample은 Sampling Variability를 줄일 수 있지만 Selection Bias를 자동으로 제거하지 않습니다.
“Random Sample이면 Population과 정확히 같은 비율로 구성된다”
아닙니다.
Random Sampling에서도 Sampling Variability가 존재합니다.
“Random Sampling과 Random Assignment는 같은 개념이다”
아닙니다.
Random Sampling은 Population에서 Sample을 선택하는 문제이고 Random Assignment는 연구 대상자를 Treatment Group 등에 배정하는 문제입니다.
“SAS에서 Random Sample을 만들면 원본 Dataset의 Bias도 제거된다”
아닙니다.
원본 Dataset 자체가 Target Population을 대표하지 못한다면 그 안에서 Random Subsample을 만들어도 원래 Bias는 그대로 남을 수 있습니다.
“Random Sample은 Normal Distribution을 따라야 한다”
아닙니다.
Randomness는 Selection Method이고 Normality는 Distribution Shape에 관한 개념입니다.
“Seed를 입력하면 Sample이 더 Random해진다”
Seed의 주요 역할은 Random Number Sequence를 관리하고 Sampling을 재현하는 데 있습니다.
“Seed가 없으면 Random Sampling이 불가능하다”
그렇지 않습니다.
첨부 교재에서는 Seed를 명시하지 않으면 Enterprise Guide가 Date와 Time을 기반으로 Seed를 사용할 수 있지만 Sample을 재현하기 어렵기 때문에 Explicit Seed를 권장합니다.
“Convenience Sample은 절대 사용할 수 없다”
그렇게 단정할 수는 없습니다.
다만 Sampling Limitation을 명확히 인식하고 결론의 Generalization 범위를 제한해야 합니다.
“Random Sampling을 했으니 Nonresponse는 문제가 되지 않는다”
아닙니다.
Random하게 선택된 대상 중 누가 실제로 응답하거나 최종 분석에 포함되었는지에 따라 Representativeness가 달라질 수 있습니다.
Random Sampling의 원리를 어떻게 기억하면 쉬울까?
다음 질문으로 기억할 수 있습니다.
“내가 Sample에 포함될 사람을 선택할 때 특정 유형의 사람이 더 쉽게 선택되는 구조가 있는가?”
있다면 Selection Bias 가능성을 확인해야 합니다.
Simple Random Sampling에서는:
Population Member
↓
각각 동일한 Selection Chance
↓
Random Mechanism
↓
Sample
이라는 구조를 사용합니다.
그리고 Sample을 얻은 뒤에는 또 하나의 질문이 필요합니다.
“이 Sample에서 얻은 결과를 내가 결론내리려는 Population까지 확장해도 되는가?”
이 질문이 Representativeness와 Generalization의 핵심입니다.
왜 Random Sampling을 이해해야 할까?
이후 배우게 될 대부분의 Inferential Statistics는 Sample에서 Population으로 결론을 확장합니다.
예를 들어:
Confidence Interval
↓
Sample Statistic으로 Population Parameter 추정
Hypothesis Test
↓
Sample Evidence로 Population Hypothesis 평가
ANOVA
↓
Sample Group Difference로 Population Mean Difference 추론
Regression
↓
Sample Relationship으로 Population Relationship 추정
따라서 Sample Selection이 잘못되면 그 이후에 아무리 정교한 Statistical Model을 사용해도 Population Inference에 한계가 생길 수 있습니다.
핵심 정리
Random Sampling은 Population에서 Sample을 선택할 때 Random Mechanism을 사용하는 방법이며, Simple Random Sampling에서는 Population의 각 구성원이 Sample에 포함될 동일한 기회를 갖습니다.
첨부 교재에서도 Simple Random Sampling을 이러한 방식으로 정의하고, Random Sampling이 Representative Sample을 확보하는 데 도움을 줄 수 있다고 설명합니다.
반면 쉽게 접근할 수 있는 대상만 선택하는 Convenience Sampling은 Biased Sample을 만들 수 있으며, 이러한 Sample은 Population을 제대로 Representative하지 못할 수 있습니다.
따라서 다음 두 문제를 구분해야 합니다.
Sampling Variability
↓
Random하게 Sample을 뽑기 때문에 자연스럽게 발생하는 Variation
그리고:
Sampling Bias
↓
Selection Mechanism 때문에 특정 방향으로 발생하는 체계적 왜곡
Large Sample은 Sampling Variability를 줄이는 데 도움을 줄 수 있지만 Bias를 자동으로 없애지는 못합니다.
전체 구조를 정리하면 다음과 같습니다.
Target Population
↓
Appropriate Sampling Frame
↓
Random Sampling
↓
Representative Sample
↓
Descriptive Statistics
↓
Inferential Statistics
↓
Population Conclusion
SAS Enterprise Guide에서도 Dataset에서 Simple Random Sample을 생성할 수 있으며, 첨부 교재에서는 Titanic Dataset의 10% Sample을 생성하는 Example을 제공합니다. 또한 명시적인 Random Seed를 사용하면 Sample을 재현할 수 있어 이를 권장합니다.
Statistical Analysis의 신뢰성은 Sample Size만으로 결정되지 않습니다. 누구를 어떤 방식으로 선택했는지가 Population에 대한 결론의 타당성을 결정하는 핵심 요소입니다.
함께 읽으면 좋은 글
- Population과 Sample의 차이: 표본으로 모집단을 추론할 수 있는 원리
- Parameter와 Statistic의 차이: 모집단 특성을 표본 통계량으로 추정하는 방식
- Descriptive와 Inferential Statistics의 차이: 표본 분석에서 모집단 추론으로 확장하는 과정
- Confidence Interval의 의미: 단일 추정값보다 범위 추정이 중요한 이유
- Statistical Significance와 Practical Significance의 차이: 유의한 결과가 반드시 중요한 것은 아닌 이유
참고한 자료
- SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
- Fundamental Statistical Concepts
- Populations and Samples
- Simple Random Sampling
- Convenience Sampling and Biased Samples
- Appendix B: Sampling from SAS Data Sets
- Random Samples in SAS Enterprise Guide




댓글 0
첫 댓글을 남겨보세요.