Measurement Scale의 중요성: 변수의 측정척도가 통계분석 방법을 결정하는 이유
SAS에서 통계분석을 시작할 때 많은 사람이 먼저 어떤 메뉴를 사용할지 고민합니다.
ANOVA를 해야 할지, Regression을 해야 할지, 아니면 Frequency Table이나 Logistic Regression을 사용해야 할지 선택하려고 합니다.
하지만 그보다 먼저 확인해야 할 것이 있습니다.
바로 Variable의 Measurement Scale, 즉 측정척도입니다.
통계분석 방법은 Variable에 어떤 값이 들어 있는지만으로 결정되지 않습니다. 그 값이 어떤 의미와 구조를 가지고 있는지가 중요합니다.
예를 들어 숫자 1, 2, 3이 저장되어 있다고 해서 반드시 연속형 Numeric Variable이라고 볼 수는 없습니다.
1 = Male, 2 = Female처럼 단순 Category Code일 수도 있고,
1 = Low, 2 = Medium, 3 = High처럼 순서가 있는 Category일 수도 있습니다.
따라서 SAS에서 Statistical Model을 선택하기 전에 각 Variable이 Nominal, Ordinal, Continuous 중 어떤 구조인지 이해하는 과정이 필요합니다.
첨부 교재에서도 Statistical Method를 선택하기 전에 각 Variable의 Measurement Scale을 먼저 확인해야 한다고 설명합니다.
Measurement Scale이란 무엇인가?
Measurement Scale은 Variable에 기록된 값이 어떤 종류의 정보를 표현하는지 설명하는 개념입니다.
단순히 값의 Data Type을 의미하는 것은 아닙니다.
예를 들어 SAS에서는 Variable이 Numeric으로 저장되어 있어도 실제 Statistical Meaning은 Categorical일 수 있습니다.
대표적인 Measurement Scale은 다음과 같이 구분할 수 있습니다.
- Nominal
- Ordinal
- Interval
- Ratio
첨부 교재에서는 실질적인 분석 관점에서 다음 세 범주를 중심으로 설명합니다.
Nominal
↓
순서가 없는 Category
Ordinal
↓
순서가 있는 Category
Continuous
↓
값의 순서뿐 아니라 값 사이의 거리도 의미가 있는 Variable
Measurement Scale은 Variable의 저장 형식보다 그 값이 실제로 무엇을 의미하는지를 분류하는 개념입니다.
Numeric Variable과 Measurement Scale은 같은 개념일까?
아닙니다.
이 둘은 반드시 구분해야 합니다.
예를 들어 다음과 같은 Data가 있다고 가정해보겠습니다.
| Patient | Treatment |
|---|---|
| A | 1 |
| B | 2 |
| C | 1 |
| D | 3 |
SAS에서는 Treatment가 Numeric Variable로 저장되어 있을 수 있습니다.
하지만 Code가 다음 의미라면:
1 = Placebo
2 = Low Dose
3 = High Dose
실제 분석에서는 단순한 연속형 수치라고 볼 수 없습니다.
특히 Treatment가 단순히 세 치료군의 Label이라면 3이 1보다 세 배 큰 Treatment라고 해석할 수 없습니다.
따라서:
Storage Type
Numeric
과
Measurement Scale
Categorical
은 서로 다른 개념입니다.
왜 숫자로 저장된 Category가 위험할까?
통계 Software는 숫자가 가진 실제 의미를 자동으로 완벽하게 이해하지 못합니다.
예를 들어 다음 Variable이 있다고 가정해보겠습니다.
Region
- 1 = Korea
- 2 = China
- 3 = USA
이 Variable을 연속형 Predictor처럼 Model에 넣으면 SAS는 숫자 간 차이를 계산 가능한 수치 관계로 처리할 수 있습니다.
하지만:
USA – Korea = 2
라는 숫자 차이에는 실제 Statistical Meaning이 없습니다.
또한 USA가 Korea보다 두 배 큰 Region이라는 의미도 없습니다.
Category를 숫자로 Coding했다고 해서 Category가 Continuous Variable로 바뀌는 것은 아닙니다.
이 때문에 Measurement Scale을 먼저 파악해야 합니다.
Nominal Variable이란 무엇인가?
Nominal Variable은 값 사이에 논리적인 순서가 존재하지 않는 범주형 Variable입니다.
첨부 교재에서는 음료 종류를 Nominal Variable의 예로 설명합니다.
각 음료 Category에 1, 2, 3 같은 Numeric Code를 부여하더라도 Category 사이에 자연스러운 순서가 생기는 것은 아닙니다.
예를 들어:
- Blood Type
- Region
- Treatment Group
- Gender Category
- Product Type
등을 생각할 수 있습니다.
다음과 같은 Coding이 있다고 가정해보겠습니다.
Treatment
1 = Placebo
2 = Drug A
3 = Drug B
여기서 3 > 2 > 1이라는 순서 자체는 Statistical Meaning을 갖지 않을 수 있습니다.
Nominal Variable에서 평균을 계산하면 의미가 있을까?
일반적으로 Category Code 자체의 Mean을 해석하는 것은 적절하지 않습니다.
예를 들어:
Korea = 1
China = 2
USA = 3
라고 Coding한 Data에서 평균이:
2.1
이라고 계산되었다고 가정해보겠습니다.
이 값은 “평균적인 국가는 2.1이다”라는 의미를 제공하지 않습니다.
Coding 번호는 Category를 구분하기 위한 Label 역할일 뿐이기 때문입니다.
이 경우에는 평균보다는 다음과 같은 정보가 더 의미 있을 수 있습니다.
- Frequency
- Proportion
- Percentage
- Mode
즉 Measurement Scale에 따라 적절한 Summary Statistic도 달라집니다.
Ordinal Variable이란 무엇인가?
Ordinal Variable은 Category이지만 값 사이에 논리적인 순서가 존재하는 Variable입니다.
첨부 교재에서는 음료 크기를 다음과 같이 예로 설명합니다.
Small
↓
Medium
↓
Large
이 경우 Small보다 Medium이 크고 Medium보다 Large가 크다는 순서는 명확합니다.
하지만 각 단계의 정확한 거리까지 동일하다고 보장할 수는 없습니다.
예를 들어:
- Mild
- Moderate
- Severe
또는
- Poor
- Fair
- Good
- Excellent
같은 Category가 Ordinal 구조를 가질 수 있습니다.
Ordinal에서 숫자의 차이는 그대로 계산할 수 있을까?
주의해야 합니다.
예를 들어 Severity를 다음과 같이 Coding했다고 가정해보겠습니다.
1 = Mild
2 = Moderate
3 = Severe
순서는 존재합니다.
하지만:
Moderate - Mild = 1
과
Severe - Moderate = 1
이 실제 임상적 또는 물리적 차이까지 동일하다는 의미는 아닙니다.
즉 숫자 간 간격이 동일하다고 보장되지 않습니다.
Ordinal Variable은 순서를 알려주지만 각 Category 사이의 정확한 거리까지 알려주지는 않습니다.
이 점이 Continuous Variable과의 중요한 차이입니다.
Nominal과 Ordinal은 무엇이 다를까?
둘 다 Categorical Variable입니다.
하지만 순서의 존재 여부가 다릅니다.
Nominal
Category 존재
↓
Logical Order 없음
예:
Korea / China / USA
Ordinal
Category 존재
↓
Logical Order 있음
예:
Low / Medium / High
따라서 분석 과정에서도 두 Variable을 항상 동일하게 취급하면 안 됩니다.
Ordinal Data에는 순서 정보가 존재하기 때문에 그 정보를 활용할 수 있는 Statistical Method가 있을 수 있습니다.
Continuous Variable이란 무엇인가?
Continuous Variable은 값에 논리적인 순서가 있고 값 사이의 차이도 의미를 갖는 Variable입니다.
첨부 교재에서는 음료의 Volume과 Temperature를 Continuous Variable의 예로 설명합니다.
대표적인 예는 다음과 같습니다.
- Height
- Weight
- Blood Pressure
- Temperature
- Time
- Concentration
예를 들어 Weight가:
60 kg
70 kg
80 kg
이라면:
70 – 60 = 10 kg
80 – 70 = 10 kg
이라는 차이는 동일한 물리적 의미를 갖습니다.
이런 특성 때문에 평균, 분산, 표준편차 같은 통계량을 사용할 수 있습니다.
Continuous Variable은 정말 모든 값을 가질 수 있을까?
이론적으로 Continuous Variable은 특정 범위 안에서 연속적인 값을 가질 수 있습니다.
예를 들어 Height는:
170
170.1
170.12
170.123
처럼 측정 정밀도에 따라 여러 값으로 표현할 수 있습니다.
실제 Data에서는 측정 장비나 기록 단위 때문에 소수점이 제한될 수 있습니다.
하지만 Measurement Scale의 개념에서는 값 사이의 연속적인 차이가 의미 있다는 점이 중요합니다.
Interval Scale이란 무엇인가?
Continuous Variable은 다시 Interval과 Ratio 수준으로 구분할 수 있습니다.
Interval Scale은 값 사이의 차이는 의미가 있지만 절대적인 0이 존재하지 않는 척도입니다.
첨부 교재에서는 Celsius Temperature를 대표적인 예로 제시합니다.
예를 들어:
10°C
20°C
30°C
에서는 10도 차이가 동일하게 의미를 갖습니다.
하지만:
20°C가 10°C보다 두 배 뜨겁다
라고 단순하게 해석할 수는 없습니다.
0°C가 열이 완전히 없는 상태를 의미하지 않기 때문입니다.
Ratio Scale이란 무엇인가?
Ratio Scale은 값 사이의 차이가 의미 있을 뿐 아니라 의미 있는 True Zero를 가진 척도입니다.
첨부 교재에서는 Volume을 Ratio Scale의 예로 제시합니다.
예를 들어:
0 mL
은 실제로 Volume이 존재하지 않는 상태를 의미할 수 있습니다.
따라서:
200 mL
은
100 mL
의 두 배라는 Ratio Interpretation이 가능합니다.
개념적으로:
Interval
차이 비교 가능
↓
Ratio 비교는 제한적
Ratio
차이 비교 가능
비율 비교 가능
이라고 이해할 수 있습니다.
SAS 분석에서는 Interval과 Ratio를 항상 구분해야 할까?
모든 분석에서 두 Scale을 반드시 별도의 Statistical Procedure로 처리하는 것은 아닙니다.
첨부 교재에서도 Interval과 Ratio를 모두 Continuous Variable 영역에서 설명합니다.
즉 많은 Statistical Analysis에서는 두 Variable 모두 Continuous Response나 Continuous Predictor로 활용될 수 있습니다.
다만 해석할 때는 차이가 중요합니다.
특히 “두 배”, “절반” 같은 Ratio Interpretation을 할 수 있는지는 True Zero의 존재 여부에 달려 있습니다.
Discrete Variable은 어디에 해당할까?
실제 Data에서는 Continuous와 Categorical 사이에서 고민되는 Variable도 존재합니다.
예를 들어 Count Data:
0명
1명
2명
3명
처럼 정수만 가질 수 있습니다.
엄밀하게는 Continuous가 아니라 Discrete Numerical Variable입니다.
첨부 교재에서도 SAT Score가 진정한 의미에서 완전한 Continuous Measure는 아니지만, Continuous Measure와 유사한 방식으로 행동하기 때문에 Course에서는 Continuous Interval-Level Measure처럼 분석한다고 설명합니다.
이 사례는 중요한 점을 보여줍니다.
Measurement Scale은 Data가 화면에서 정수인지 소수인지보다 해당 Measure가 Statistical Analysis에서 어떤 성질을 갖는지가 중요합니다.
SAT Score가 왜 흥미로운 예일까?
SAT Score는 특정 가능한 점수값만 존재하기 때문에 엄밀한 의미에서는 완전히 연속적인 값이라고 보기 어렵습니다.
하지만 교육자료에서는 이런 점수형 Measure가 Continuous Measure와 비슷한 분석적 특성을 보일 수 있기 때문에 Continuous Variable처럼 취급할 수 있다고 설명합니다.
즉 Statistical Analysis에서는 때때로:
이론적 Measurement Scale
과
실제 분석 목적에서 사용하는 Statistical Treatment
를 함께 고려해야 합니다.
Measurement Scale은 Statistical Model과 어떻게 연결될까?
첨부 교재에서는 Predictor와 Response의 Type에 따라 선택할 수 있는 Statistical Model을 구분합니다.
예를 들어 Continuous Response를 분석할 때:
Categorical Predictor
↓
ANOVA
Continuous Predictor
↓
Ordinary Least Squares Regression
Continuous + Categorical Predictors
↓
ANCOVA
같은 구조를 제시합니다.
반면 Response 자체가 Categorical이라면:
Categorical Data Analysis
또는
Logistic Regression
과 같은 방법을 고려할 수 있습니다.
Variable의 Measurement Scale을 잘못 판단하면 Statistical Model 선택부터 잘못될 수 있습니다.
Response Variable이 중요한 이유
통계분석에서 Response Variable은 분석하고 싶은 Outcome입니다.
예를 들어 연구 질문이:
“Treatment Group에 따라 Blood Pressure가 다른가?”
라고 가정해보겠습니다.
여기서:
Predictor
Treatment Group
↓
Categorical
Response
Blood Pressure
↓
Continuous
이므로 Group 간 Continuous Mean을 비교하는 구조가 됩니다.
이런 경우 ANOVA와 같은 분석을 고려할 수 있습니다.
Response가 Categorical이면 무엇이 달라질까?
이번에는 질문을 바꿔보겠습니다.
“Age와 Treatment가 Treatment Success 여부와 관련이 있는가?”
여기서:
Response
Success / Failure
↓
Categorical
입니다.
Response 자체가 Category이기 때문에 일반적인 Linear Regression과는 다른 Model이 필요할 수 있습니다.
첨부 교재의 Statistical Model Overview에서도 Categorical Response에는 Logistic Regression 등을 연결합니다.
Predictor만 보고 분석 방법을 결정하면 안 되는 이유
예를 들어 Age라는 Continuous Predictor가 있다고 가정해보겠습니다.
Age가 Continuous라는 이유만으로 Linear Regression을 사용한다고 결정할 수는 없습니다.
Response가 무엇인지 함께 봐야 합니다.
Response = Blood Pressure
Continuous
↓
Linear Regression 고려
Response = Disease Yes / No
Categorical
↓
Logistic Regression 고려
즉 동일한 Predictor라도 Response Type에 따라 Statistical Method가 달라질 수 있습니다.
통계모형 선택에서는 Predictor와 Response의 Measurement Scale을 함께 확인해야 합니다.
ANOVA는 왜 Categorical Predictor와 잘 연결될까?
ANOVA에서는 여러 Group의 Mean을 비교합니다.
예를 들어 Treatment Group이:
- Placebo
- Drug A
- Drug B
이고 Response가:
Blood Pressure
라고 가정해보겠습니다.
구조는 다음과 같습니다.
Categorical Predictor
Treatment
↓
Continuous Response
Blood Pressure
↓
Group Mean Comparison
↓
ANOVA
즉 Group을 정의하는 Predictor는 Category이고 비교할 결과는 Continuous인 구조입니다.
Regression은 왜 Continuous Predictor와 연결될까?
예를 들어 Age가 증가할수록 Blood Pressure가 어떻게 변하는지 분석한다고 가정해보겠습니다.
Age
Continuous Predictor
↓
Blood Pressure
Continuous Response
↓
두 Continuous Variable의 관계
↓
Linear Regression
형태로 접근할 수 있습니다.
이 경우 Group Mean을 비교하는 것보다 Predictor 값 변화에 따른 Response 변화량을 Modeling하는 것이 목적입니다.
ANCOVA는 어떤 구조일까?
첨부 교재에서는 Continuous Response에 Categorical Predictor와 Continuous Predictor가 함께 존재하는 경우 ANCOVA를 연결합니다.
예를 들어:
Treatment
Categorical
Baseline Score
Continuous
↓
Outcome
Continuous
같은 구조입니다.
즉 Treatment Group 차이를 분석하면서 Baseline 같은 Continuous Covariate의 영향을 함께 고려할 수 있습니다.
Measurement Scale을 잘못 지정하면 어떤 문제가 생길까?
예를 들어 Severity를:
1 = Mild
2 = Moderate
3 = Severe
로 Coding했다고 가정해보겠습니다.
Ordinal Variable인데 단순 Continuous Variable처럼 사용하면 Model은 다음을 암묵적으로 가정할 수 있습니다.
Mild → Moderate의 차이
=
Moderate → Severe의 차이
하지만 실제 임상적 차이가 동일하다는 보장은 없습니다.
또 Region Code:
1 = Korea
2 = China
3 = USA
를 Continuous Predictor로 사용하면 더 큰 문제가 생깁니다.
이 경우 숫자 Coding 자체가 인위적인데도 Model은 Linear Relationship을 계산할 수 있습니다.
Category Code를 바꾸면 결과가 달라지는 분석은 의심해야 할까?
매우 유용한 사고방식입니다.
예를 들어 Region을:
Korea = 1
China = 2
USA = 3
로 Coding했다고 합시다.
이를:
Korea = 10
China = 20
USA = 30
으로 바꿨을 때 Statistical Interpretation이 달라진다면 Category Code가 Numeric Quantity처럼 잘못 사용되고 있는지 확인할 필요가 있습니다.
Nominal Category의 숫자는 단순 Label이기 때문에 Code 번호 자체가 Statistical Distance를 만들면 안 되는 경우가 많습니다.
Binary Variable은 Nominal일까?
Yes/No처럼 두 개 Category를 가진 Variable은 일반적으로 Categorical Variable입니다.
예:
0 = No
1 = Yes
숫자가 0과 1이라도 그 자체로 Continuous Variable이라고 볼 수 없습니다.
다만 Statistical Model에서는 0/1 Coding이 특정 수학적 표현에 활용될 수 있습니다.
중요한 것은:
0과 1이 숫자로 저장되어 있다는 사실
보다
실제 Outcome이 두 개 Category를 가진다는 사실
입니다.
ID Number는 Numeric일까?
Subject ID가 다음과 같이 있다고 가정해보겠습니다.
1001
1002
1003
SAS에서는 Numeric으로 저장할 수 있습니다.
하지만 Statistical Meaning에서는 단순 Identifier입니다.
평균 Subject ID를 계산하거나 Subject ID가 증가하면 Outcome이 변한다고 해석하는 것은 일반적으로 의미가 없습니다.
따라서 다음을 구분해야 합니다.
Numeric Storage
≠
Quantitative Measurement
숫자로 기록된 Variable이라고 해서 반드시 수량을 측정한 Variable은 아닙니다.
Date는 어떤 Variable일까?
Date도 흥미로운 예입니다.
SAS에서는 Date를 내부적으로 Numeric Value로 관리하면서 Format을 통해 사람이 읽을 수 있는 날짜로 표시할 수 있습니다.
따라서 화면에서는:
24AUG2026
처럼 보이더라도 내부적으로 Numeric 값일 수 있습니다.
분석 목적에 따라 Date는:
- Time Interval 계산
- Ordering
- Duration 계산
- Time Trend Analysis
등에 사용될 수 있습니다.
즉 Storage Type만 보고 Statistical Role을 결정하면 안 됩니다.
Measurement Scale과 Summary Statistic은 어떻게 연결될까?
Variable의 Scale에 따라 적절한 Summary Statistic도 달라집니다.
Nominal
Frequency
Percentage
Mode
Ordinal
Median
Percentile
Frequency
Continuous
Mean
Standard Deviation
Median
Quartile
Range
등을 사용할 수 있습니다.
첨부 교재에서도 Mean은 대칭적인 Interval 또는 Ratio Scale Variable에 적절하고, Median은 Ordinal 또는 Skewed Continuous Data에 활용할 수 있으며 Mode는 Nominal Variable에 적합하다고 설명합니다.
평균을 항상 대표값으로 사용하면 안 되는 이유
Mean은 매우 익숙한 통계량입니다.
하지만 모든 Data에서 가장 좋은 중심값은 아닙니다.
예를 들어 소득 Data처럼 매우 Skewed된 Distribution에서는 극단적인 High Income이 Mean을 크게 끌어올릴 수 있습니다.
이 경우 Median이 중심 위치를 더 잘 표현할 수 있습니다.
또 Nominal Variable에서는 Mean 자체가 의미 없을 수 있습니다.
즉 Measurement Scale과 Distribution을 함께 고려해야 합니다.
Ordinal Variable에서는 Median이 유용한 이유
Ordinal Variable에는 순서 정보가 존재합니다.
따라서 정렬했을 때 가운데 위치를 나타내는 Median을 사용할 수 있습니다.
예를 들어 Satisfaction이:
Very Dissatisfied
Dissatisfied
Neutral
Satisfied
Very Satisfied
순서라면 Median Category를 해석할 수 있습니다.
반면 Mean을 계산하기 위해 임의의 숫자 Coding을 사용하는 경우 Category 사이의 간격이 동일하다는 가정이 들어갈 수 있으므로 신중해야 합니다.
Measurement Scale과 Graph 선택도 연결될까?
그렇습니다.
Data Type에 따라 적절한 Visualization도 달라질 수 있습니다.
예를 들어:
Categorical Variable
Bar Chart
Frequency Plot
Continuous Variable
Histogram
Box Plot
Scatter Plot
등이 사용될 수 있습니다.
Continuous Variable 두 개의 관계를 확인하려면 Scatter Plot이 유용하지만 Nominal Category 두 개에 Scatter Plot을 사용하는 것은 일반적인 목적과 맞지 않을 수 있습니다.
Dataset을 받으면 Measurement Scale부터 확인해야 할까?
분석 전에 각 Variable을 다음과 같이 분류하면 도움이 됩니다.
| Variable | Statistical Role | Measurement Scale |
|---|---|---|
| Subject ID | Identifier | Nominal |
| Treatment | Predictor | Nominal |
| Severity | Predictor/Response | Ordinal |
| Age | Predictor | Continuous |
| Weight | Predictor | Continuous |
| Outcome Score | Response | Continuous |
| Response Y/N | Response | Nominal |
이렇게 정리하면 Statistical Model을 선택할 때 훨씬 명확해집니다.
SAS의 Numeric과 Character만 확인하면 부족한 이유
SAS Dataset에서는 Variable Type을 크게 Numeric과 Character로 확인할 수 있습니다.
하지만 Statistical Analysis 관점에서는 이것만으로 부족합니다.
예를 들어 다음 Variable이 모두 Numeric일 수 있습니다.
- Subject ID
- Treatment Code
- Severity Score
- Age
- Weight
하지만 Statistical Meaning은 각각 다릅니다.
Subject ID
Identifier
Treatment Code
Nominal
Severity Score
Ordinal
Age
Continuous
Weight
Continuous
따라서 SAS Data Type 확인 이후 Measurement Scale을 추가로 판단해야 합니다.
Statistical Software가 Scale을 자동으로 완벽하게 판단할 수 있을까?
항상 그렇지는 않습니다.
Software는 Data Type과 사용자가 지정한 Role을 기반으로 계산합니다.
하지만 1, 2, 3이:
- Category Code인지
- Ordinal Level인지
- 실제 Numeric Measurement인지
Software가 연구 맥락 없이 완벽하게 판단할 수는 없습니다.
따라서 Statistical Analyst가 Variable의 의미를 이해해야 합니다.
SAS가 계산을 수행할 수 있다는 것과 SAS가 Variable의 의미를 이해한다는 것은 다른 문제입니다.
Data Dictionary가 중요한 이유
실제 Data Analysis에서는 Variable Name만 보고 Measurement Scale을 판단하기 어려운 경우가 많습니다.
예를 들어:
TRT
RESP
SEV
라는 Variable이 있다고 가정해보겠습니다.
이름만 보면 실제 값의 의미를 정확히 알기 어렵습니다.
Data Dictionary에는 다음 정보가 있으면 도움이 됩니다.
- Variable Name
- Label
- Data Type
- Coding
- Unit
- Category Definition
- Missing Code
이를 통해 Measurement Scale을 정확하게 판단할 수 있습니다.
Coding된 Missing Value도 주의해야 한다
예를 들어 Score가:
1~5
범위인데:
99 = Missing
으로 Coding되어 있다고 가정해보겠습니다.
99를 실제 Score로 처리하면 Mean과 Distribution이 크게 왜곡될 수 있습니다.
또:
9 = Unknown
8 = Not Applicable
같은 Special Code가 존재할 수도 있습니다.
따라서 Measurement Scale을 확인할 때 Category Coding과 Missing Coding을 함께 살펴봐야 합니다.
Unit도 Measurement 해석에 중요하다
Continuous Variable에서는 Unit이 중요합니다.
예를 들어 Weight가:
70
이라고 기록되어 있어도:
70 kg
인지
70 lb
인지에 따라 의미가 완전히 달라집니다.
같은 Continuous Scale이라고 해도 Unit이 서로 다른 Data를 그대로 합치면 잘못된 분석 결과가 나올 수 있습니다.
따라서 Data Structure를 확인할 때:
Value
Scale
Unit
을 함께 봐야 합니다.
Measurement Scale과 Distribution은 별개의 문제다
Continuous Variable이라고 해서 반드시 Normal Distribution을 따르는 것은 아닙니다.
예를 들어 Income은 Ratio Scale의 Continuous Variable일 수 있지만 매우 Right-Skewed될 수 있습니다.
따라서 다음 두 질문은 서로 다릅니다.
Measurement Scale은 무엇인가?
↓
어떤 종류의 값인가?
그리고
Distribution은 어떤 형태인가?
↓
값이 어떻게 퍼져 있는가?
두 요소 모두 Statistical Method 선택에 영향을 줄 수 있습니다.
Scale이 같아도 분석 방법이 달라질 수 있다
예를 들어 Continuous Response라고 해서 항상 같은 Statistical Method를 사용하는 것은 아닙니다.
다음 요소도 고려해야 합니다.
- Predictor Type
- Number of Groups
- Distribution
- Independence
- Study Design
- Repeated Measurement
- Model Assumption
Measurement Scale은 분석 방법을 결정하는 출발점이지 유일한 기준은 아닙니다.
좋은 Statistical Model 선택은 Measurement Scale에서 시작하지만 Measurement Scale만으로 끝나지는 않습니다.
Statistical Question이 Scale보다 먼저일까?
두 요소는 함께 봐야 합니다.
같은 Variable이라도 Research Question에 따라 역할이 달라질 수 있습니다.
예를 들어 Age는 Continuous Variable입니다.
연구 A에서는 Age가 Predictor일 수 있습니다.
연구 B에서는 Age 자체를 Group으로 나눠 Category로 사용할 수도 있습니다.
따라서 분석 전에는 다음 순서가 유용합니다.
Research Question
↓
Response 정의
↓
Predictor 정의
↓
Measurement Scale 확인
↓
Statistical Method 선택
Continuous Variable을 Category로 바꾸면 정보가 줄어들 수 있다
예를 들어 Age라는 Continuous Variable을:
<65
≥65
두 Group으로 나눈다고 가정해보겠습니다.
이렇게 하면 분석이 단순해질 수 있지만 원래 Age가 가지고 있던 세부 정보가 줄어듭니다.
64세와 20세가 같은 Group이 되고,
65세와 90세도 같은 Group이 됩니다.
따라서 Continuous Variable을 임의로 Category화할 때는 분석 목적과 정보 손실을 고려해야 합니다.
Ordinal을 Continuous처럼 다루는 경우도 있을까?
실제 연구에서는 여러 Level을 가진 Ordinal Score를 Continuous처럼 분석하는 경우가 있을 수 있습니다.
하지만 이는 항상 자동으로 적절한 선택이라고 볼 수 없습니다.
다음 요소를 고려해야 할 수 있습니다.
- Category 수
- Scale의 성질
- Distribution
- 연구 분야의 관행
- Model Assumption
첨부 교재의 SAT Score 사례처럼 엄밀한 Scale과 분석에서의 실용적인 취급이 다를 수 있다는 점을 기억할 필요가 있습니다.
분석 전에 사용할 수 있는 Measurement Scale 점검 방법
Dataset을 처음 받았다면 각 Variable에 다음 질문을 적용해볼 수 있습니다.
1. 값은 Category인가?
Yes라면 Nominal 또는 Ordinal을 고려합니다.
2. Category에 자연스러운 순서가 있는가?
Yes라면 Ordinal을 고려합니다.
3. 숫자 차이가 실제 의미를 갖는가?
Yes라면 Quantitative Scale일 가능성이 높습니다.
4. 의미 있는 Zero가 존재하는가?
Yes라면 Ratio Scale을 고려할 수 있습니다.
5. 숫자는 단순 Code인가?
그렇다면 Numeric으로 저장되어 있어도 Categorical일 수 있습니다.
Measurement Scale 판단의 전체 구조
다음과 같이 정리할 수 있습니다.
Variable
↓
값이 Category인가?
Yes
↓
순서가 있는가?
No
↓
Nominal
Yes
↓
Ordinal
No
↓
숫자 차이가 의미 있는가?
↓
Continuous / Quantitative
↓
True Zero가 있는가?
No
↓
Interval
Yes
↓
Ratio
이 구조는 복잡한 Statistical Method를 선택하기 전에 Variable의 성질을 이해하는 기본 단계입니다.
흔한 오해 정리
“Numeric Variable은 모두 Continuous다”
아닙니다.
Category Code나 Identifier도 Numeric으로 저장될 수 있습니다.
“1, 2, 3은 숫자이므로 평균을 계산하면 된다”
반드시 그렇지 않습니다.
숫자가 Category Label이라면 Mean은 의미가 없을 수 있습니다.
“Nominal과 Ordinal은 모두 Category이므로 동일하다”
둘 다 Categorical이지만 Ordinal에는 순서 정보가 존재합니다.
“Ordinal Variable의 1→2 차이와 2→3 차이는 동일하다”
그렇게 단정할 수 없습니다.
Ordinal Scale은 순서를 제공하지만 Category 간 동일한 거리를 보장하지 않습니다.
“Continuous Variable이면 반드시 Normal Distribution이다”
아닙니다.
Measurement Scale과 Distribution Shape은 서로 다른 개념입니다.
“SAS가 Variable Type을 알고 있으니 Measurement Scale도 자동으로 안다”
항상 그렇지는 않습니다.
SAS의 Numeric/Character Type과 Statistical Measurement Scale은 다른 개념입니다.
“Measurement Scale만 알면 Statistical Method가 자동으로 결정된다”
아닙니다.
Response와 Predictor 역할, Study Design, Distribution, Statistical Assumption 등을 함께 고려해야 합니다.
Measurement Scale과 Statistical Model의 전체 연결 구조
첨부 교재의 Model 구조를 단순화하면 다음과 같이 이해할 수 있습니다.
Research Question
↓
Response Variable
Predictor Variable
↓
Measurement Scale 확인
↓
Continuous Response + Categorical Predictor
ANOVA
Continuous Response + Continuous Predictor
OLS Regression
Continuous Response + Categorical & Continuous Predictors
ANCOVA
Categorical Response
Categorical Data Analysis / Logistic Regression
Statistical Model을 선택하기 전에 Response와 Predictor가 어떤 Measurement Scale을 가지고 있는지 확인하는 것이 기본입니다.
왜 Measurement Scale을 먼저 이해해야 할까?
이후 SAS 분석에서는 다음과 같은 개념을 배우게 됩니다.
Nominal / Ordinal
↓
Categorical Data
Continuous
↓
Descriptive Statistics
↓
t-Test
↓
ANOVA
↓
Regression
그리고 Response Type에 따라:
Categorical Response
↓
Logistic Regression
으로 연결될 수 있습니다.
따라서 Measurement Scale을 이해하지 않고 개별 Procedure만 외우면 어떤 상황에서 어떤 분석을 선택해야 하는지 판단하기 어렵습니다.
핵심 정리
Measurement Scale은 Variable의 값이 어떤 종류의 정보를 표현하는지를 설명합니다.
SAS에서 Variable이 Numeric인지 Character인지만 확인해서는 충분하지 않습니다.
예를 들어 Numeric Variable이라도:
- Identifier
- Nominal Category
- Ordinal Category
- Continuous Measurement
중 하나일 수 있습니다.
첨부 교재에서는 분석 전에 Variable을 Continuous, Nominal, Ordinal 등으로 분류해야 하며, Predictor와 Response의 Type에 따라 ANOVA, OLS Regression, ANCOVA, Logistic Regression 같은 Statistical Model이 달라질 수 있다고 설명합니다.
전체 흐름을 정리하면 다음과 같습니다.
Research Question
↓
Variable 역할 확인
↓
Measurement Scale 확인
↓
Response / Predictor 구조 파악
↓
Statistical Model 선택
↓
SAS Analysis
Measurement Scale을 정확하게 판단하는 것은 통계 결과를 해석하기 위한 부가적인 지식이 아니라, 처음부터 올바른 Statistical Method를 선택하기 위한 출발점입니다.
함께 읽으면 좋은 글
- Nominal과 Ordinal Variable의 차이: 범주형 변수의 순서가 분석에 미치는 영향
- Interval과 Ratio Scale의 차이: 연속형 변수에서 절대적 0이 중요한 이유
- Predictor와 Response Variable의 구조: 설명변수와 반응변수의 역할 이해
- 변수 유형과 통계모형의 관계: ANOVA·Regression·Logistic Regression 선택 기준
- Descriptive Statistics의 목적: 본격적인 분석 전에 데이터를 진단해야 하는 이유
참고한 자료
- SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
- Fundamental Statistical Concepts
- Measurement Scales: Nominal, Ordinal and Continuous Variables
- Overview of Statistical Models
- Central Tendency and Descriptive Statistics




댓글 0
첫 댓글을 남겨보세요.