본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

Measurement Scale의 중요성: 변수의 측정척도가 통계분석 방법을 결정하는 이유

읽는 시간 약 43분

SAS에서 통계분석을 시작할 때 많은 사람이 먼저 어떤 메뉴를 사용할지 고민합니다.

ANOVA를 해야 할지, Regression을 해야 할지, 아니면 Frequency Table이나 Logistic Regression을 사용해야 할지 선택하려고 합니다.

하지만 그보다 먼저 확인해야 할 것이 있습니다.

바로 Variable의 Measurement Scale, 즉 측정척도입니다.

통계분석 방법은 Variable에 어떤 값이 들어 있는지만으로 결정되지 않습니다. 그 값이 어떤 의미와 구조를 가지고 있는지가 중요합니다.

예를 들어 숫자 1, 2, 3이 저장되어 있다고 해서 반드시 연속형 Numeric Variable이라고 볼 수는 없습니다.

1 = Male, 2 = Female처럼 단순 Category Code일 수도 있고,

1 = Low, 2 = Medium, 3 = High처럼 순서가 있는 Category일 수도 있습니다.

따라서 SAS에서 Statistical Model을 선택하기 전에 각 Variable이 Nominal, Ordinal, Continuous 중 어떤 구조인지 이해하는 과정이 필요합니다.

첨부 교재에서도 Statistical Method를 선택하기 전에 각 Variable의 Measurement Scale을 먼저 확인해야 한다고 설명합니다.

Measurement Scale이란 무엇인가?

Measurement Scale은 Variable에 기록된 값이 어떤 종류의 정보를 표현하는지 설명하는 개념입니다.

단순히 값의 Data Type을 의미하는 것은 아닙니다.

예를 들어 SAS에서는 Variable이 Numeric으로 저장되어 있어도 실제 Statistical Meaning은 Categorical일 수 있습니다.

대표적인 Measurement Scale은 다음과 같이 구분할 수 있습니다.

  • Nominal
  • Ordinal
  • Interval
  • Ratio

첨부 교재에서는 실질적인 분석 관점에서 다음 세 범주를 중심으로 설명합니다.

Nominal

순서가 없는 Category

Ordinal

순서가 있는 Category

Continuous

값의 순서뿐 아니라 값 사이의 거리도 의미가 있는 Variable

Measurement Scale은 Variable의 저장 형식보다 그 값이 실제로 무엇을 의미하는지를 분류하는 개념입니다.

Numeric Variable과 Measurement Scale은 같은 개념일까?

아닙니다.

이 둘은 반드시 구분해야 합니다.

예를 들어 다음과 같은 Data가 있다고 가정해보겠습니다.

PatientTreatment
A1
B2
C1
D3

SAS에서는 Treatment가 Numeric Variable로 저장되어 있을 수 있습니다.

하지만 Code가 다음 의미라면:

1 = Placebo

2 = Low Dose

3 = High Dose

실제 분석에서는 단순한 연속형 수치라고 볼 수 없습니다.

특히 Treatment가 단순히 세 치료군의 Label이라면 31보다 세 배 큰 Treatment라고 해석할 수 없습니다.

따라서:

Storage Type

Numeric

Measurement Scale

Categorical

은 서로 다른 개념입니다.

왜 숫자로 저장된 Category가 위험할까?

통계 Software는 숫자가 가진 실제 의미를 자동으로 완벽하게 이해하지 못합니다.

예를 들어 다음 Variable이 있다고 가정해보겠습니다.

Region

  • 1 = Korea
  • 2 = China
  • 3 = USA

이 Variable을 연속형 Predictor처럼 Model에 넣으면 SAS는 숫자 간 차이를 계산 가능한 수치 관계로 처리할 수 있습니다.

하지만:

USA – Korea = 2

라는 숫자 차이에는 실제 Statistical Meaning이 없습니다.

또한 USA가 Korea보다 두 배 큰 Region이라는 의미도 없습니다.

Category를 숫자로 Coding했다고 해서 Category가 Continuous Variable로 바뀌는 것은 아닙니다.

이 때문에 Measurement Scale을 먼저 파악해야 합니다.

Nominal Variable이란 무엇인가?

Nominal Variable은 값 사이에 논리적인 순서가 존재하지 않는 범주형 Variable입니다.

첨부 교재에서는 음료 종류를 Nominal Variable의 예로 설명합니다.

각 음료 Category에 1, 2, 3 같은 Numeric Code를 부여하더라도 Category 사이에 자연스러운 순서가 생기는 것은 아닙니다.

예를 들어:

  • Blood Type
  • Region
  • Treatment Group
  • Gender Category
  • Product Type

등을 생각할 수 있습니다.

다음과 같은 Coding이 있다고 가정해보겠습니다.

Treatment

1 = Placebo

2 = Drug A

3 = Drug B

여기서 3 > 2 > 1이라는 순서 자체는 Statistical Meaning을 갖지 않을 수 있습니다.

Nominal Variable에서 평균을 계산하면 의미가 있을까?

일반적으로 Category Code 자체의 Mean을 해석하는 것은 적절하지 않습니다.

예를 들어:

Korea = 1

China = 2

USA = 3

라고 Coding한 Data에서 평균이:

2.1

이라고 계산되었다고 가정해보겠습니다.

이 값은 “평균적인 국가는 2.1이다”라는 의미를 제공하지 않습니다.

Coding 번호는 Category를 구분하기 위한 Label 역할일 뿐이기 때문입니다.

이 경우에는 평균보다는 다음과 같은 정보가 더 의미 있을 수 있습니다.

  • Frequency
  • Proportion
  • Percentage
  • Mode

즉 Measurement Scale에 따라 적절한 Summary Statistic도 달라집니다.

Ordinal Variable이란 무엇인가?

Ordinal Variable은 Category이지만 값 사이에 논리적인 순서가 존재하는 Variable입니다.

첨부 교재에서는 음료 크기를 다음과 같이 예로 설명합니다.

Small

Medium

Large

이 경우 Small보다 Medium이 크고 Medium보다 Large가 크다는 순서는 명확합니다.

하지만 각 단계의 정확한 거리까지 동일하다고 보장할 수는 없습니다.

예를 들어:

  • Mild
  • Moderate
  • Severe

또는

  • Poor
  • Fair
  • Good
  • Excellent

같은 Category가 Ordinal 구조를 가질 수 있습니다.

Ordinal에서 숫자의 차이는 그대로 계산할 수 있을까?

주의해야 합니다.

예를 들어 Severity를 다음과 같이 Coding했다고 가정해보겠습니다.

1 = Mild

2 = Moderate

3 = Severe

순서는 존재합니다.

하지만:

Moderate - Mild = 1

Severe - Moderate = 1

이 실제 임상적 또는 물리적 차이까지 동일하다는 의미는 아닙니다.

즉 숫자 간 간격이 동일하다고 보장되지 않습니다.

Ordinal Variable은 순서를 알려주지만 각 Category 사이의 정확한 거리까지 알려주지는 않습니다.

이 점이 Continuous Variable과의 중요한 차이입니다.

Nominal과 Ordinal은 무엇이 다를까?

둘 다 Categorical Variable입니다.

하지만 순서의 존재 여부가 다릅니다.

Nominal

Category 존재

Logical Order 없음

예:

Korea / China / USA

Ordinal

Category 존재

Logical Order 있음

예:

Low / Medium / High

따라서 분석 과정에서도 두 Variable을 항상 동일하게 취급하면 안 됩니다.

Ordinal Data에는 순서 정보가 존재하기 때문에 그 정보를 활용할 수 있는 Statistical Method가 있을 수 있습니다.

Continuous Variable이란 무엇인가?

Continuous Variable은 값에 논리적인 순서가 있고 값 사이의 차이도 의미를 갖는 Variable입니다.

첨부 교재에서는 음료의 Volume과 Temperature를 Continuous Variable의 예로 설명합니다.

대표적인 예는 다음과 같습니다.

  • Height
  • Weight
  • Blood Pressure
  • Temperature
  • Time
  • Concentration

예를 들어 Weight가:

60 kg

70 kg

80 kg

이라면:

70 – 60 = 10 kg

80 – 70 = 10 kg

이라는 차이는 동일한 물리적 의미를 갖습니다.

이런 특성 때문에 평균, 분산, 표준편차 같은 통계량을 사용할 수 있습니다.

Continuous Variable은 정말 모든 값을 가질 수 있을까?

이론적으로 Continuous Variable은 특정 범위 안에서 연속적인 값을 가질 수 있습니다.

예를 들어 Height는:

170

170.1

170.12

170.123

처럼 측정 정밀도에 따라 여러 값으로 표현할 수 있습니다.

실제 Data에서는 측정 장비나 기록 단위 때문에 소수점이 제한될 수 있습니다.

하지만 Measurement Scale의 개념에서는 값 사이의 연속적인 차이가 의미 있다는 점이 중요합니다.

Interval Scale이란 무엇인가?

Continuous Variable은 다시 Interval과 Ratio 수준으로 구분할 수 있습니다.

Interval Scale은 값 사이의 차이는 의미가 있지만 절대적인 0이 존재하지 않는 척도입니다.

첨부 교재에서는 Celsius Temperature를 대표적인 예로 제시합니다.

예를 들어:

10°C

20°C

30°C

에서는 10도 차이가 동일하게 의미를 갖습니다.

하지만:

20°C가 10°C보다 두 배 뜨겁다

라고 단순하게 해석할 수는 없습니다.

0°C가 열이 완전히 없는 상태를 의미하지 않기 때문입니다.

Ratio Scale이란 무엇인가?

Ratio Scale은 값 사이의 차이가 의미 있을 뿐 아니라 의미 있는 True Zero를 가진 척도입니다.

첨부 교재에서는 Volume을 Ratio Scale의 예로 제시합니다.

예를 들어:

0 mL

은 실제로 Volume이 존재하지 않는 상태를 의미할 수 있습니다.

따라서:

200 mL

100 mL

의 두 배라는 Ratio Interpretation이 가능합니다.

개념적으로:

Interval

차이 비교 가능

Ratio 비교는 제한적

Ratio

차이 비교 가능

비율 비교 가능

이라고 이해할 수 있습니다.

SAS 분석에서는 Interval과 Ratio를 항상 구분해야 할까?

모든 분석에서 두 Scale을 반드시 별도의 Statistical Procedure로 처리하는 것은 아닙니다.

첨부 교재에서도 Interval과 Ratio를 모두 Continuous Variable 영역에서 설명합니다.

즉 많은 Statistical Analysis에서는 두 Variable 모두 Continuous Response나 Continuous Predictor로 활용될 수 있습니다.

다만 해석할 때는 차이가 중요합니다.

특히 “두 배”, “절반” 같은 Ratio Interpretation을 할 수 있는지는 True Zero의 존재 여부에 달려 있습니다.

Discrete Variable은 어디에 해당할까?

실제 Data에서는 Continuous와 Categorical 사이에서 고민되는 Variable도 존재합니다.

예를 들어 Count Data:

0명

1명

2명

3명

처럼 정수만 가질 수 있습니다.

엄밀하게는 Continuous가 아니라 Discrete Numerical Variable입니다.

첨부 교재에서도 SAT Score가 진정한 의미에서 완전한 Continuous Measure는 아니지만, Continuous Measure와 유사한 방식으로 행동하기 때문에 Course에서는 Continuous Interval-Level Measure처럼 분석한다고 설명합니다.

이 사례는 중요한 점을 보여줍니다.

Measurement Scale은 Data가 화면에서 정수인지 소수인지보다 해당 Measure가 Statistical Analysis에서 어떤 성질을 갖는지가 중요합니다.

SAT Score가 왜 흥미로운 예일까?

SAT Score는 특정 가능한 점수값만 존재하기 때문에 엄밀한 의미에서는 완전히 연속적인 값이라고 보기 어렵습니다.

하지만 교육자료에서는 이런 점수형 Measure가 Continuous Measure와 비슷한 분석적 특성을 보일 수 있기 때문에 Continuous Variable처럼 취급할 수 있다고 설명합니다.

즉 Statistical Analysis에서는 때때로:

이론적 Measurement Scale

실제 분석 목적에서 사용하는 Statistical Treatment

를 함께 고려해야 합니다.

Measurement Scale은 Statistical Model과 어떻게 연결될까?

첨부 교재에서는 Predictor와 Response의 Type에 따라 선택할 수 있는 Statistical Model을 구분합니다.

예를 들어 Continuous Response를 분석할 때:

Categorical Predictor

ANOVA

Continuous Predictor

Ordinary Least Squares Regression

Continuous + Categorical Predictors

ANCOVA

같은 구조를 제시합니다.

반면 Response 자체가 Categorical이라면:

Categorical Data Analysis

또는

Logistic Regression

과 같은 방법을 고려할 수 있습니다.

Variable의 Measurement Scale을 잘못 판단하면 Statistical Model 선택부터 잘못될 수 있습니다.

Response Variable이 중요한 이유

통계분석에서 Response Variable은 분석하고 싶은 Outcome입니다.

예를 들어 연구 질문이:

“Treatment Group에 따라 Blood Pressure가 다른가?”

라고 가정해보겠습니다.

여기서:

Predictor

Treatment Group

Categorical

Response

Blood Pressure

Continuous

이므로 Group 간 Continuous Mean을 비교하는 구조가 됩니다.

이런 경우 ANOVA와 같은 분석을 고려할 수 있습니다.

Response가 Categorical이면 무엇이 달라질까?

이번에는 질문을 바꿔보겠습니다.

“Age와 Treatment가 Treatment Success 여부와 관련이 있는가?”

여기서:

Response

Success / Failure

Categorical

입니다.

Response 자체가 Category이기 때문에 일반적인 Linear Regression과는 다른 Model이 필요할 수 있습니다.

첨부 교재의 Statistical Model Overview에서도 Categorical Response에는 Logistic Regression 등을 연결합니다.

Predictor만 보고 분석 방법을 결정하면 안 되는 이유

예를 들어 Age라는 Continuous Predictor가 있다고 가정해보겠습니다.

Age가 Continuous라는 이유만으로 Linear Regression을 사용한다고 결정할 수는 없습니다.

Response가 무엇인지 함께 봐야 합니다.

Response = Blood Pressure

Continuous

Linear Regression 고려

Response = Disease Yes / No

Categorical

Logistic Regression 고려

즉 동일한 Predictor라도 Response Type에 따라 Statistical Method가 달라질 수 있습니다.

통계모형 선택에서는 Predictor와 Response의 Measurement Scale을 함께 확인해야 합니다.

ANOVA는 왜 Categorical Predictor와 잘 연결될까?

ANOVA에서는 여러 Group의 Mean을 비교합니다.

예를 들어 Treatment Group이:

  • Placebo
  • Drug A
  • Drug B

이고 Response가:

Blood Pressure

라고 가정해보겠습니다.

구조는 다음과 같습니다.

Categorical Predictor

Treatment

Continuous Response

Blood Pressure

Group Mean Comparison

ANOVA

즉 Group을 정의하는 Predictor는 Category이고 비교할 결과는 Continuous인 구조입니다.

Regression은 왜 Continuous Predictor와 연결될까?

예를 들어 Age가 증가할수록 Blood Pressure가 어떻게 변하는지 분석한다고 가정해보겠습니다.

Age

Continuous Predictor

Blood Pressure

Continuous Response

두 Continuous Variable의 관계

Linear Regression

형태로 접근할 수 있습니다.

이 경우 Group Mean을 비교하는 것보다 Predictor 값 변화에 따른 Response 변화량을 Modeling하는 것이 목적입니다.

ANCOVA는 어떤 구조일까?

첨부 교재에서는 Continuous Response에 Categorical Predictor와 Continuous Predictor가 함께 존재하는 경우 ANCOVA를 연결합니다.

예를 들어:

Treatment

Categorical

Baseline Score

Continuous

Outcome

Continuous

같은 구조입니다.

즉 Treatment Group 차이를 분석하면서 Baseline 같은 Continuous Covariate의 영향을 함께 고려할 수 있습니다.

Measurement Scale을 잘못 지정하면 어떤 문제가 생길까?

예를 들어 Severity를:

1 = Mild

2 = Moderate

3 = Severe

로 Coding했다고 가정해보겠습니다.

Ordinal Variable인데 단순 Continuous Variable처럼 사용하면 Model은 다음을 암묵적으로 가정할 수 있습니다.

Mild → Moderate의 차이

=

Moderate → Severe의 차이

하지만 실제 임상적 차이가 동일하다는 보장은 없습니다.

또 Region Code:

1 = Korea

2 = China

3 = USA

를 Continuous Predictor로 사용하면 더 큰 문제가 생깁니다.

이 경우 숫자 Coding 자체가 인위적인데도 Model은 Linear Relationship을 계산할 수 있습니다.

Category Code를 바꾸면 결과가 달라지는 분석은 의심해야 할까?

매우 유용한 사고방식입니다.

예를 들어 Region을:

Korea = 1

China = 2

USA = 3

로 Coding했다고 합시다.

이를:

Korea = 10

China = 20

USA = 30

으로 바꿨을 때 Statistical Interpretation이 달라진다면 Category Code가 Numeric Quantity처럼 잘못 사용되고 있는지 확인할 필요가 있습니다.

Nominal Category의 숫자는 단순 Label이기 때문에 Code 번호 자체가 Statistical Distance를 만들면 안 되는 경우가 많습니다.

Binary Variable은 Nominal일까?

Yes/No처럼 두 개 Category를 가진 Variable은 일반적으로 Categorical Variable입니다.

예:

0 = No

1 = Yes

숫자가 0과 1이라도 그 자체로 Continuous Variable이라고 볼 수 없습니다.

다만 Statistical Model에서는 0/1 Coding이 특정 수학적 표현에 활용될 수 있습니다.

중요한 것은:

01이 숫자로 저장되어 있다는 사실

보다

실제 Outcome이 두 개 Category를 가진다는 사실

입니다.

ID Number는 Numeric일까?

Subject ID가 다음과 같이 있다고 가정해보겠습니다.

1001

1002

1003

SAS에서는 Numeric으로 저장할 수 있습니다.

하지만 Statistical Meaning에서는 단순 Identifier입니다.

평균 Subject ID를 계산하거나 Subject ID가 증가하면 Outcome이 변한다고 해석하는 것은 일반적으로 의미가 없습니다.

따라서 다음을 구분해야 합니다.

Numeric Storage

Quantitative Measurement

숫자로 기록된 Variable이라고 해서 반드시 수량을 측정한 Variable은 아닙니다.

Date는 어떤 Variable일까?

Date도 흥미로운 예입니다.

SAS에서는 Date를 내부적으로 Numeric Value로 관리하면서 Format을 통해 사람이 읽을 수 있는 날짜로 표시할 수 있습니다.

따라서 화면에서는:

24AUG2026

처럼 보이더라도 내부적으로 Numeric 값일 수 있습니다.

분석 목적에 따라 Date는:

  • Time Interval 계산
  • Ordering
  • Duration 계산
  • Time Trend Analysis

등에 사용될 수 있습니다.

즉 Storage Type만 보고 Statistical Role을 결정하면 안 됩니다.

Measurement Scale과 Summary Statistic은 어떻게 연결될까?

Variable의 Scale에 따라 적절한 Summary Statistic도 달라집니다.

Nominal

Frequency

Percentage

Mode

Ordinal

Median

Percentile

Frequency

Continuous

Mean

Standard Deviation

Median

Quartile

Range

등을 사용할 수 있습니다.

첨부 교재에서도 Mean은 대칭적인 Interval 또는 Ratio Scale Variable에 적절하고, Median은 Ordinal 또는 Skewed Continuous Data에 활용할 수 있으며 Mode는 Nominal Variable에 적합하다고 설명합니다.

평균을 항상 대표값으로 사용하면 안 되는 이유

Mean은 매우 익숙한 통계량입니다.

하지만 모든 Data에서 가장 좋은 중심값은 아닙니다.

예를 들어 소득 Data처럼 매우 Skewed된 Distribution에서는 극단적인 High Income이 Mean을 크게 끌어올릴 수 있습니다.

이 경우 Median이 중심 위치를 더 잘 표현할 수 있습니다.

또 Nominal Variable에서는 Mean 자체가 의미 없을 수 있습니다.

즉 Measurement Scale과 Distribution을 함께 고려해야 합니다.

Ordinal Variable에서는 Median이 유용한 이유

Ordinal Variable에는 순서 정보가 존재합니다.

따라서 정렬했을 때 가운데 위치를 나타내는 Median을 사용할 수 있습니다.

예를 들어 Satisfaction이:

Very Dissatisfied

Dissatisfied

Neutral

Satisfied

Very Satisfied

순서라면 Median Category를 해석할 수 있습니다.

반면 Mean을 계산하기 위해 임의의 숫자 Coding을 사용하는 경우 Category 사이의 간격이 동일하다는 가정이 들어갈 수 있으므로 신중해야 합니다.

Measurement Scale과 Graph 선택도 연결될까?

그렇습니다.

Data Type에 따라 적절한 Visualization도 달라질 수 있습니다.

예를 들어:

Categorical Variable

Bar Chart

Frequency Plot

Continuous Variable

Histogram

Box Plot

Scatter Plot

등이 사용될 수 있습니다.

Continuous Variable 두 개의 관계를 확인하려면 Scatter Plot이 유용하지만 Nominal Category 두 개에 Scatter Plot을 사용하는 것은 일반적인 목적과 맞지 않을 수 있습니다.

Dataset을 받으면 Measurement Scale부터 확인해야 할까?

분석 전에 각 Variable을 다음과 같이 분류하면 도움이 됩니다.

VariableStatistical RoleMeasurement Scale
Subject IDIdentifierNominal
TreatmentPredictorNominal
SeverityPredictor/ResponseOrdinal
AgePredictorContinuous
WeightPredictorContinuous
Outcome ScoreResponseContinuous
Response Y/NResponseNominal

이렇게 정리하면 Statistical Model을 선택할 때 훨씬 명확해집니다.

SAS의 Numeric과 Character만 확인하면 부족한 이유

SAS Dataset에서는 Variable Type을 크게 Numeric과 Character로 확인할 수 있습니다.

하지만 Statistical Analysis 관점에서는 이것만으로 부족합니다.

예를 들어 다음 Variable이 모두 Numeric일 수 있습니다.

  • Subject ID
  • Treatment Code
  • Severity Score
  • Age
  • Weight

하지만 Statistical Meaning은 각각 다릅니다.

Subject ID

Identifier

Treatment Code

Nominal

Severity Score

Ordinal

Age

Continuous

Weight

Continuous

따라서 SAS Data Type 확인 이후 Measurement Scale을 추가로 판단해야 합니다.

Statistical Software가 Scale을 자동으로 완벽하게 판단할 수 있을까?

항상 그렇지는 않습니다.

Software는 Data Type과 사용자가 지정한 Role을 기반으로 계산합니다.

하지만 1, 2, 3이:

  • Category Code인지
  • Ordinal Level인지
  • 실제 Numeric Measurement인지

Software가 연구 맥락 없이 완벽하게 판단할 수는 없습니다.

따라서 Statistical Analyst가 Variable의 의미를 이해해야 합니다.

SAS가 계산을 수행할 수 있다는 것과 SAS가 Variable의 의미를 이해한다는 것은 다른 문제입니다.

Data Dictionary가 중요한 이유

실제 Data Analysis에서는 Variable Name만 보고 Measurement Scale을 판단하기 어려운 경우가 많습니다.

예를 들어:

TRT

RESP

SEV

라는 Variable이 있다고 가정해보겠습니다.

이름만 보면 실제 값의 의미를 정확히 알기 어렵습니다.

Data Dictionary에는 다음 정보가 있으면 도움이 됩니다.

  • Variable Name
  • Label
  • Data Type
  • Coding
  • Unit
  • Category Definition
  • Missing Code

이를 통해 Measurement Scale을 정확하게 판단할 수 있습니다.

Coding된 Missing Value도 주의해야 한다

예를 들어 Score가:

1~5

범위인데:

99 = Missing

으로 Coding되어 있다고 가정해보겠습니다.

99를 실제 Score로 처리하면 Mean과 Distribution이 크게 왜곡될 수 있습니다.

또:

9 = Unknown

8 = Not Applicable

같은 Special Code가 존재할 수도 있습니다.

따라서 Measurement Scale을 확인할 때 Category Coding과 Missing Coding을 함께 살펴봐야 합니다.

Unit도 Measurement 해석에 중요하다

Continuous Variable에서는 Unit이 중요합니다.

예를 들어 Weight가:

70

이라고 기록되어 있어도:

70 kg

인지

70 lb

인지에 따라 의미가 완전히 달라집니다.

같은 Continuous Scale이라고 해도 Unit이 서로 다른 Data를 그대로 합치면 잘못된 분석 결과가 나올 수 있습니다.

따라서 Data Structure를 확인할 때:

Value

Scale

Unit

을 함께 봐야 합니다.

Measurement Scale과 Distribution은 별개의 문제다

Continuous Variable이라고 해서 반드시 Normal Distribution을 따르는 것은 아닙니다.

예를 들어 Income은 Ratio Scale의 Continuous Variable일 수 있지만 매우 Right-Skewed될 수 있습니다.

따라서 다음 두 질문은 서로 다릅니다.

Measurement Scale은 무엇인가?

어떤 종류의 값인가?

그리고

Distribution은 어떤 형태인가?

값이 어떻게 퍼져 있는가?

두 요소 모두 Statistical Method 선택에 영향을 줄 수 있습니다.

Scale이 같아도 분석 방법이 달라질 수 있다

예를 들어 Continuous Response라고 해서 항상 같은 Statistical Method를 사용하는 것은 아닙니다.

다음 요소도 고려해야 합니다.

  • Predictor Type
  • Number of Groups
  • Distribution
  • Independence
  • Study Design
  • Repeated Measurement
  • Model Assumption

Measurement Scale은 분석 방법을 결정하는 출발점이지 유일한 기준은 아닙니다.

좋은 Statistical Model 선택은 Measurement Scale에서 시작하지만 Measurement Scale만으로 끝나지는 않습니다.

Statistical Question이 Scale보다 먼저일까?

두 요소는 함께 봐야 합니다.

같은 Variable이라도 Research Question에 따라 역할이 달라질 수 있습니다.

예를 들어 Age는 Continuous Variable입니다.

연구 A에서는 Age가 Predictor일 수 있습니다.

연구 B에서는 Age 자체를 Group으로 나눠 Category로 사용할 수도 있습니다.

따라서 분석 전에는 다음 순서가 유용합니다.

Research Question

Response 정의

Predictor 정의

Measurement Scale 확인

Statistical Method 선택

Continuous Variable을 Category로 바꾸면 정보가 줄어들 수 있다

예를 들어 Age라는 Continuous Variable을:

<65

≥65

두 Group으로 나눈다고 가정해보겠습니다.

이렇게 하면 분석이 단순해질 수 있지만 원래 Age가 가지고 있던 세부 정보가 줄어듭니다.

64세와 20세가 같은 Group이 되고,

65세와 90세도 같은 Group이 됩니다.

따라서 Continuous Variable을 임의로 Category화할 때는 분석 목적과 정보 손실을 고려해야 합니다.

Ordinal을 Continuous처럼 다루는 경우도 있을까?

실제 연구에서는 여러 Level을 가진 Ordinal Score를 Continuous처럼 분석하는 경우가 있을 수 있습니다.

하지만 이는 항상 자동으로 적절한 선택이라고 볼 수 없습니다.

다음 요소를 고려해야 할 수 있습니다.

  • Category 수
  • Scale의 성질
  • Distribution
  • 연구 분야의 관행
  • Model Assumption

첨부 교재의 SAT Score 사례처럼 엄밀한 Scale과 분석에서의 실용적인 취급이 다를 수 있다는 점을 기억할 필요가 있습니다.

분석 전에 사용할 수 있는 Measurement Scale 점검 방법

Dataset을 처음 받았다면 각 Variable에 다음 질문을 적용해볼 수 있습니다.

1. 값은 Category인가?

Yes라면 Nominal 또는 Ordinal을 고려합니다.

2. Category에 자연스러운 순서가 있는가?

Yes라면 Ordinal을 고려합니다.

3. 숫자 차이가 실제 의미를 갖는가?

Yes라면 Quantitative Scale일 가능성이 높습니다.

4. 의미 있는 Zero가 존재하는가?

Yes라면 Ratio Scale을 고려할 수 있습니다.

5. 숫자는 단순 Code인가?

그렇다면 Numeric으로 저장되어 있어도 Categorical일 수 있습니다.

Measurement Scale 판단의 전체 구조

다음과 같이 정리할 수 있습니다.

Variable

값이 Category인가?

Yes

순서가 있는가?

No

Nominal

Yes

Ordinal

No

숫자 차이가 의미 있는가?

Continuous / Quantitative

True Zero가 있는가?

No

Interval

Yes

Ratio

이 구조는 복잡한 Statistical Method를 선택하기 전에 Variable의 성질을 이해하는 기본 단계입니다.

흔한 오해 정리

“Numeric Variable은 모두 Continuous다”

아닙니다.

Category Code나 Identifier도 Numeric으로 저장될 수 있습니다.

“1, 2, 3은 숫자이므로 평균을 계산하면 된다”

반드시 그렇지 않습니다.

숫자가 Category Label이라면 Mean은 의미가 없을 수 있습니다.

“Nominal과 Ordinal은 모두 Category이므로 동일하다”

둘 다 Categorical이지만 Ordinal에는 순서 정보가 존재합니다.

“Ordinal Variable의 1→2 차이와 2→3 차이는 동일하다”

그렇게 단정할 수 없습니다.

Ordinal Scale은 순서를 제공하지만 Category 간 동일한 거리를 보장하지 않습니다.

“Continuous Variable이면 반드시 Normal Distribution이다”

아닙니다.

Measurement Scale과 Distribution Shape은 서로 다른 개념입니다.

“SAS가 Variable Type을 알고 있으니 Measurement Scale도 자동으로 안다”

항상 그렇지는 않습니다.

SAS의 Numeric/Character Type과 Statistical Measurement Scale은 다른 개념입니다.

“Measurement Scale만 알면 Statistical Method가 자동으로 결정된다”

아닙니다.

Response와 Predictor 역할, Study Design, Distribution, Statistical Assumption 등을 함께 고려해야 합니다.

Measurement Scale과 Statistical Model의 전체 연결 구조

첨부 교재의 Model 구조를 단순화하면 다음과 같이 이해할 수 있습니다.

Research Question

Response Variable

Predictor Variable

Measurement Scale 확인

Continuous Response + Categorical Predictor

ANOVA

Continuous Response + Continuous Predictor

OLS Regression

Continuous Response + Categorical & Continuous Predictors

ANCOVA

Categorical Response

Categorical Data Analysis / Logistic Regression

Statistical Model을 선택하기 전에 Response와 Predictor가 어떤 Measurement Scale을 가지고 있는지 확인하는 것이 기본입니다.

왜 Measurement Scale을 먼저 이해해야 할까?

이후 SAS 분석에서는 다음과 같은 개념을 배우게 됩니다.

Nominal / Ordinal

Categorical Data

Continuous

Descriptive Statistics

t-Test

ANOVA

Regression

그리고 Response Type에 따라:

Categorical Response

Logistic Regression

으로 연결될 수 있습니다.

따라서 Measurement Scale을 이해하지 않고 개별 Procedure만 외우면 어떤 상황에서 어떤 분석을 선택해야 하는지 판단하기 어렵습니다.

핵심 정리

Measurement Scale은 Variable의 값이 어떤 종류의 정보를 표현하는지를 설명합니다.

SAS에서 Variable이 Numeric인지 Character인지만 확인해서는 충분하지 않습니다.

예를 들어 Numeric Variable이라도:

  • Identifier
  • Nominal Category
  • Ordinal Category
  • Continuous Measurement

중 하나일 수 있습니다.

첨부 교재에서는 분석 전에 Variable을 Continuous, Nominal, Ordinal 등으로 분류해야 하며, Predictor와 Response의 Type에 따라 ANOVA, OLS Regression, ANCOVA, Logistic Regression 같은 Statistical Model이 달라질 수 있다고 설명합니다.
전체 흐름을 정리하면 다음과 같습니다.

Research Question

Variable 역할 확인

Measurement Scale 확인

Response / Predictor 구조 파악

Statistical Model 선택

SAS Analysis

Measurement Scale을 정확하게 판단하는 것은 통계 결과를 해석하기 위한 부가적인 지식이 아니라, 처음부터 올바른 Statistical Method를 선택하기 위한 출발점입니다.

함께 읽으면 좋은 글

  • Nominal과 Ordinal Variable의 차이: 범주형 변수의 순서가 분석에 미치는 영향
  • Interval과 Ratio Scale의 차이: 연속형 변수에서 절대적 0이 중요한 이유
  • Predictor와 Response Variable의 구조: 설명변수와 반응변수의 역할 이해
  • 변수 유형과 통계모형의 관계: ANOVA·Regression·Logistic Regression 선택 기준
  • Descriptive Statistics의 목적: 본격적인 분석 전에 데이터를 진단해야 하는 이유

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Fundamental Statistical Concepts
  • Measurement Scales: Nominal, Ordinal and Continuous Variables
  • Overview of Statistical Models
  • Central Tendency and Descriptive Statistics

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.