본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

Nominal과 Ordinal Variable의 차이: 범주형 변수의 순서가 분석에 미치는 영향

읽는 시간 약 46분

통계분석에서 Categorical Variable은 모두 비슷해 보일 수 있습니다.

Gender, Region, Treatment Group, Disease Severity, Satisfaction Level처럼 몇 개의 Category로 나누어진 Variable은 모두 범주형 데이터이기 때문입니다.

하지만 범주형 Variable에는 중요한 차이가 있습니다.

바로 Category 사이에 의미 있는 순서가 존재하는가입니다.

Nominal Variable은 Category를 구분하지만 자연스러운 순서가 없고, Ordinal Variable은 Category를 구분하면서 동시에 순서 정보까지 가지고 있습니다.

이 차이는 단순한 용어 구분이 아닙니다.

어떤 Summary Statistic을 사용할지, Category를 어떻게 Coding할지, 어떤 Statistical Method를 선택할지, 결과를 어떻게 해석할지에 영향을 줄 수 있습니다.

첨부 교재에서도 분석 전에 Variable의 Measurement Scale을 Continuous, Nominal, Ordinal로 구분해야 하며, 적절한 Statistical Method를 선택하려면 이 구조를 먼저 확인해야 한다고 설명합니다.

Nominal Variable이란 무엇인가?

Nominal Variable은 여러 Category로 구성되지만 Category 사이에 논리적인 순서가 존재하지 않는 Variable입니다.

예를 들어 음료 종류를 생각해보겠습니다.

  • Coffee
  • Tea
  • Juice

세 Category가 존재하지만 어느 것이 더 높거나 낮다고 말할 수 없습니다.

Coffee > Tea

또는

Juice < Coffee

같은 관계는 의미가 없습니다.

첨부 교재에서도 Beverage Type을 Nominal Variable의 예로 들면서, Category에 숫자 1, 2, 3을 부여하더라도 값 사이에 논리적인 Ordering은 존재하지 않는다고 설명합니다.

Nominal에서 Category의 핵심 기능은 순위를 나타내는 것이 아니라 서로 다른 집단을 구분하는 것입니다.

Nominal이라는 이름은 무엇을 의미할까?

Nominal은 쉽게 말하면 Name 또는 Label의 성격을 가진 Category라고 이해할 수 있습니다.

예를 들어:

Region

Korea

China

USA

또는

Blood Type

A

B

AB

O

같은 Variable을 생각할 수 있습니다.

각 값은 어떤 Group에 속하는지를 알려줍니다.

하지만 Category 사이의 크기나 순위를 알려주는 것은 아닙니다.

즉 Nominal Variable은:

Observation

어느 Category에 속하는가?

를 표현하는 데 초점이 있습니다.

Nominal Variable의 대표적인 예

실제 Data에서는 다양한 Nominal Variable을 볼 수 있습니다.

예를 들어:

  • Country
  • Region
  • Blood Type
  • Treatment Group
  • Product Category
  • Vehicle Type
  • Disease Type
  • Department

등이 있을 수 있습니다.

첨부 교재의 Safety Dataset에서는 TypeRegion을 Nominal Variable로 분류합니다.

예를 들어 Region이:

Asia

North America

두 Category로 구성되어 있다면 두 지역을 구분할 수는 있지만 어느 지역이 더 높은 Category라고 말할 수는 없습니다.

Nominal Variable에 숫자를 붙이면 Numeric Variable이 될까?

아닙니다.

이 부분은 매우 중요합니다.

예를 들어 Treatment Group을 다음과 같이 Coding했다고 가정해보겠습니다.

1 = Placebo

2 = Drug A

3 = Drug B

SAS Dataset에서 이 Variable은 Numeric Type으로 저장될 수 있습니다.

하지만 Statistical Meaning은 여전히 Nominal일 수 있습니다.

왜냐하면:

Drug B > Drug A > Placebo

라는 수학적 순서를 의미하지 않기 때문입니다.

또한:

Drug B – Placebo = 2

라는 차이에도 의미가 없습니다.

Category를 숫자로 Coding한 것은 저장 방법일 뿐 Measurement Scale을 바꾸는 것이 아닙니다.

Category Code는 Label에 가깝다

Nominal Variable의 숫자는 수량보다는 Label에 가깝습니다.

예를 들어:

Korea = 1

China = 2

USA = 3

이라고 Coding해도 다음과 같이 바꿀 수 있습니다.

Korea = 30

China = 10

USA = 20

Category의 본질은 변하지 않습니다.

Korea가 Korea이고 China가 China라는 정보가 중요하지 숫자 크기는 중요하지 않기 때문입니다.

따라서 Nominal Variable에서는 Coding Number에 수학적인 의미를 부여하면 안 됩니다.

Nominal Variable의 평균을 계산하면 왜 이상할까?

다음과 같은 Region Code가 있다고 가정해보겠습니다.

Korea = 1

China = 2

USA = 3

관측값이:

1, 1, 2, 3, 3

이라면 Mean을 계산할 수는 있습니다.

하지만 평균이:

2.0

이라고 나왔다고 해서

“평균 국가가 China다”

라고 해석하는 것은 의미가 없습니다.

더구나 Coding을 다음과 같이 바꾸면:

Korea = 100

China = 200

USA = 300

Mean도 완전히 달라집니다.

하지만 실제 Category Distribution은 전혀 변하지 않았습니다.

따라서 Nominal Variable에서는 일반적으로 다음과 같은 정보가 더 중요합니다.

  • Frequency
  • Percentage
  • Proportion
  • Mode

Frequency가 중요한 이유

Categorical Data에서는 각 Category에 Observation이 몇 개 존재하는지를 확인하는 것이 기본입니다.

예를 들어 Treatment Group이:

TreatmentN
Placebo120
Drug A118
Drug B122

처럼 구성되어 있다면 각 Group의 크기를 바로 확인할 수 있습니다.

이를 Percentage로 바꾸면 전체 Data에서 각 Category가 차지하는 비율도 확인할 수 있습니다.

첨부 교재에서도 Categorical Variable을 설명할 때 One-Way Frequency Table을 생성하고 Frequency와 Percentage를 확인하는 구조를 사용합니다.

Ordinal Variable이란 무엇인가?

Ordinal Variable도 여러 Category로 구성됩니다.

하지만 Nominal과 달리 Category 사이에 자연스럽고 의미 있는 순서가 있습니다.

예를 들어:

Satisfaction

Very Dissatisfied

Dissatisfied

Neutral

Satisfied

Very Satisfied

처럼 구성되어 있다면 어떤 Category가 더 높은 수준인지 판단할 수 있습니다.

또는:

Disease Severity

Mild

Moderate

Severe

도 같은 구조입니다.

Ordinal Variable의 핵심은 Category뿐 아니라 Category의 순위 정보까지 가지고 있다는 것입니다.

Ordinal의 대표적인 예

다음과 같은 Variable이 Ordinal 구조를 가질 수 있습니다.

  • Satisfaction Level
  • Disease Severity
  • Pain Grade
  • Education Level
  • Risk Category
  • Product Rating
  • Functional Status
  • Tumor Stage와 같은 일부 Stage 구조

다만 실제 Measurement Scale은 연구 목적과 정의에 따라 확인해야 합니다.

단순히 Category Name만 보고 자동으로 Ordinal이라고 결정하는 것은 적절하지 않을 수 있습니다.

첨부 교재에서는 Ordinal을 어떻게 설명할까?

첨부 교재에서는 분석 전에 Nominal과 Ordinal을 구분하고 있으며, Safety Dataset에서 Size를 Ordinal Variable로 분류합니다.

Size는 다음과 같이 Coding됩니다.

1 = Small or Sports

2 = Medium

3 = Large or Sport/Utility

여기에는 작은 크기에서 큰 크기로 이어지는 Order가 존재합니다.

반면 같은 Dataset의 Type은 Large, Medium, Small, Sport/Utility, Sports 같은 Category를 단순 Vehicle Type으로 사용할 경우 Nominal로 분류합니다.
이 예는 Nominal과 Ordinal의 차이를 잘 보여줍니다.

같은 정보도 정의 방법에 따라 Scale이 달라질 수 있을까?

가능합니다.

Vehicle 관련 Data를 생각해보겠습니다.

Type

  • Large
  • Medium
  • Small
  • Sport/Utility
  • Sports

이것은 차량의 종류를 구분하는 Category라면 Nominal일 수 있습니다.

반면 이를 분석 목적에 따라:

Size

1 = Small

2 = Medium

3 = Large

처럼 크기 순서에 초점을 맞추어 재구성했다면 Ordinal 구조를 가질 수 있습니다.

첨부 교재에서도 Safety Dataset에서 Type은 Nominal, Size는 Ordinal로 구분하고 있습니다.

Variable Name보다 중요한 것은 Category가 실제로 어떤 정보를 표현하도록 정의되었는가입니다.

Ordinal Variable에서도 숫자 간 거리는 같은 것일까?

그렇다고 단정할 수 없습니다.

예를 들어 Disease Severity를:

1 = Mild

2 = Moderate

3 = Severe

라고 Coding했다고 가정해보겠습니다.

숫자 차이는:

Moderate – Mild = 1

Severe – Moderate = 1

입니다.

하지만 실제 임상적 Severity 차이가 정확히 같은 크기라는 의미는 아닙니다.

즉:

Ordinal

순서는 알 수 있음

하지만

Category 간 Distance

동일하다고 보장되지 않음

입니다.

이 점이 Interval 또는 Ratio 같은 Quantitative Scale과 중요한 차이입니다.

숫자가 1, 2, 3이라고 동일한 간격을 가정하면 안 되는 이유

예를 들어 Satisfaction을 다음과 같이 Coding한다고 가정해보겠습니다.

1 = Very Dissatisfied

2 = Dissatisfied

3 = Neutral

4 = Satisfied

5 = Very Satisfied

숫자만 보면:

1 → 2

2 → 3

3 → 4

4 → 5

가 모두 1씩 증가합니다.

그러나 사람의 심리적 Satisfaction 차이가 각 단계에서 정확히 같은 양만큼 증가한다고 보장할 수는 없습니다.

따라서 Ordinal Score를 Continuous Variable처럼 사용하는 경우에는 Scale의 성질과 분석 목적을 신중하게 고려해야 합니다.

Nominal과 Ordinal의 핵심 차이

두 개념을 가장 간단하게 비교하면 다음과 같습니다.

Nominal

Category

있음

Order

없음

Ordinal

Category

있음

Order

있음

Equal Distance

보장되지 않음

즉 Ordinal은 Nominal보다 한 가지 정보가 더 있습니다.

바로 순위 정보입니다.

Binary Variable은 Nominal일까 Ordinal일까?

두 Category만 가진 Binary Variable은 상황에 따라 해석이 필요합니다.

예를 들어:

0 = No

1 = Yes

라는 Variable이 있다고 가정해보겠습니다.

두 Category를 단순히 다른 상태로 구분한다면 Nominal로 볼 수 있습니다.

하지만 특정 맥락에서는:

No < Yes

와 같은 방향성을 생각할 수도 있습니다.

첨부 교재의 Safety Dataset에서 Unsafe는:

0 = Average or Above

1 = Below Average

로 정의되며 Solution에서는 이를 Nominal, Ordinal, Binary로 함께 표시합니다.

이는 Binary Variable이 분석 문맥에 따라 여러 성질을 가질 수 있음을 보여줍니다.

Binary는 왜 특별한 범주일까?

Binary Variable은 Category가 정확히 두 개입니다.

예:

  • Yes / No
  • Success / Failure
  • Survived / Died
  • Positive / Negative

두 Category만 존재하기 때문에 Category 사이 순서를 설정할 수 있는 경우가 있습니다.

하지만 많은 Statistical Analysis에서는 Binary Response를 별도의 구조로 다룹니다.

예를 들어 다음과 같은 Question을 생각할 수 있습니다.

Treatment

Patient가 Survived 했는가?

Response:

0 = Died

1 = Survived

이러한 Binary Response는 이후 Logistic Regression과 연결될 수 있습니다.

Ordinal Category의 순서를 뒤집어도 될까?

Coding 자체는 바꿀 수 있지만 해석 방향이 달라질 수 있습니다.

예를 들어:

1 = Mild

2 = Moderate

3 = Severe

대신:

3 = Mild

2 = Moderate

1 = Severe

로 Coding할 수도 있습니다.

Category 사이의 순서는 여전히 존재하지만 숫자의 증가 방향이 반대가 됩니다.

따라서 분석에서 순위 방향을 사용하는 경우에는 Coding Direction을 명확하게 확인해야 합니다.

Ordinal Variable에서는 숫자가 단순 Label을 넘어 순서 정보를 표현할 수 있기 때문에 Coding 방향이 중요합니다.

Nominal Variable에서는 Coding 순서가 중요하지 않은 이유

반대로 Nominal에서는 Category Number의 순서를 바꿔도 본질적인 의미가 달라지지 않습니다.

예를 들어 Region을:

1 = Asia

2 = North America

라고 하든,

1 = North America

2 = Asia

라고 하든,

Category 자체가 올바르게 구분되어 있다면 Nominal이라는 Measurement Scale은 변하지 않습니다.

하지만 특정 Statistical Model에서 어떤 Category를 Reference로 사용하는지에 따라 Parameter Interpretation은 달라질 수 있으므로 Reference Category 문제와 Measurement Scale 문제는 별도로 구분해야 합니다.

Reference Category와 Ordinal Order는 같은 것일까?

아닙니다.

예를 들어 Treatment라는 Nominal Variable에:

Placebo

Drug A

Drug B

가 있다고 가정해보겠습니다.

Logistic Regression에서 Placebo를 Reference Category로 사용할 수 있습니다.

그러나 Placebo가 Reference라고 해서:

Placebo < Drug A < Drug B

라는 Ordinal Order가 생기는 것은 아닙니다.

Reference Category는 비교 기준이고,

Ordinal Order는 Variable 자체에 존재하는 순위 구조입니다.

둘을 혼동하면 안 됩니다.

Nominal Data는 어떤 방식으로 요약할까?

Nominal Variable에서는 일반적으로 각 Category가 얼마나 자주 나타나는지를 확인합니다.

예를 들어 Region이:

RegionFrequencyPercentage
Asia36536.5%
North America63563.5%

처럼 요약될 수 있습니다.

이런 방식은 Category Distribution을 이해하는 데 유용합니다.

첨부 교재의 Safety Dataset Solution에서도 North America에서 제조된 차량의 비율을 Frequency Table을 통해 계산하고 있습니다.

Ordinal Data도 Frequency Table을 사용할 수 있을까?

물론입니다.

Ordinal도 Categorical Variable이므로 Frequency와 Percentage를 확인할 수 있습니다.

예를 들어 Disease Severity가:

SeverityN%
Mild5226%
Moderate9849%
Severe5025%

처럼 나타날 수 있습니다.

다만 Ordinal에서는 추가로 Category Order를 활용한 해석이 가능합니다.

예를 들어:

  • Mild 이하
  • Moderate 이하
  • Severe 이하

처럼 누적적인 구조를 생각할 수 있습니다.

Cumulative Percentage가 Ordinal에서 유용한 이유

Ordinal Data에서는 Category가 순서대로 배열되므로 누적 비율이 의미를 가질 수 있습니다.

예를 들어 Satisfaction이:

Level%Cumulative %
Very Dissatisfied1010
Dissatisfied1525
Neutral2550
Satisfied3080
Very Satisfied20100

이라면:

전체의 50%가 Neutral 이하

라는 해석을 할 수 있습니다.

Nominal에서는 Category 순서 자체가 임의적이기 때문에 이런 누적 해석의 의미가 일반적으로 훨씬 제한적입니다.

Median은 Ordinal에서 사용할 수 있을까?

Ordinal에는 순서가 있으므로 Median 개념을 적용할 수 있습니다.

예를 들어 정렬된 Satisfaction Data에서 가운데 Observation이 Satisfied라면 Median Category를 설명할 수 있습니다.

반면 Nominal에는 순서가 없기 때문에 가운데 Category 자체를 정의할 수 없습니다.

따라서:

Nominal

Mode, Frequency, Percentage

Ordinal

Frequency, Percentage

Median, Percentile과 같은 순위 기반 요약을 고려 가능

이라는 차이를 생각할 수 있습니다.

Mode는 Nominal에서도 사용할 수 있다

Mode는 가장 자주 나타나는 값을 의미합니다.

순서가 없어도 계산할 수 있기 때문에 Nominal Data에서도 의미가 있습니다.

예를 들어 Blood Type Data에서:

A = 40%

B = 25%

AB = 10%

O = 25%

라면 Mode는 A형입니다.

여기에는 숫자 크기나 순서가 필요하지 않습니다.

단순히 가장 많이 나타난 Category만 찾으면 됩니다.

Ordinal Variable의 Mean을 사용해도 될까?

이 부분은 상황에 따라 신중하게 판단해야 합니다.

Ordinal Category에 1, 2, 3, 4, 5를 부여하면 수학적으로 Mean을 계산할 수 있습니다.

하지만 Mean을 해석하려면 Category 사이의 간격이 어느 정도 동일하다고 보는 가정이 개입될 수 있습니다.

예를 들어 평균 Satisfaction Score가:

3.8

이라고 나왔다고 가정해보겠습니다.

실무에서 이런 평균을 사용하는 분야도 있지만 Ordinal Scale의 이론적 성질을 생각하면 각 Level 사이 Distance가 동일한지를 고려해야 합니다.

따라서 “숫자로 Coding되어 있으므로 Mean을 계산하면 된다”는 식으로 단순화하면 안 됩니다.

Nominal Variable 두 개의 관계는 어떻게 분석할까?

두 Categorical Variable 사이의 Association을 확인할 수 있습니다.

예를 들어:

Region

Asia / North America

Safety

Below Average / Average or Above

의 관계를 분석한다고 가정해보겠습니다.

먼저 Crosstabulation을 만들 수 있습니다.

Region × Safety

Two-Way Frequency Table

그 다음 두 Categorical Variable 사이 Association을 검토할 수 있습니다.

첨부 교재에서도 Safety Dataset에서 Region × Unsafe Crosstabulation을 만들고 Chi-Square Test of Association을 수행합니다.

Chi-Square Test는 무엇을 확인할까?

Chi-Square Test of Association은 두 Categorical Variable 사이에 Association이 있는지를 평가하는 데 사용할 수 있습니다.

예를 들어:

Region과 Safety가 서로 독립적인가?

를 분석할 수 있습니다.

기본적인 질문은 다음과 같습니다.

Observed Frequency

두 Variable이 독립적이라고 가정했을 때의

Expected Frequency

가 얼마나 다른가?

입니다.

이 개념은 이후 Categorical Data Analysis에서 더 자세하게 다룰 수 있습니다.

Ordinal Variable에서는 순서를 활용할 수 있을까?

이것이 Nominal과의 중요한 차이입니다.

Ordinal Variable에는 순서 정보가 있으므로 단순 Category Association 외에도 Ordering을 활용하는 분석 방법을 고려할 수 있습니다.

첨부 교재에서도 Safety Dataset에서 SizeUnsafe 사이의 Ordinal Association을 별도로 살펴보는 Exercise를 제공합니다.

즉 Category가 있다는 사실만 보는 것이 아니라:

Small

Medium

Large

라는 순서를 분석에 활용할 수 있는 것입니다.

순서 정보를 무시하면 어떤 문제가 생길까?

Ordinal Variable을 Nominal처럼 처리하면 반드시 틀린 분석이라는 뜻은 아닙니다.

하지만 데이터가 가지고 있는 추가적인 Order Information을 사용하지 못할 수 있습니다.

예를 들어:

Low

Medium

High

라는 Risk Level이 있다고 가정해보겠습니다.

이를 단순 세 Category로만 처리하면:

Low와 Medium의 관계

Medium과 High의 관계

에 존재하는 순서 정보를 활용하지 않습니다.

따라서 연구 질문이 Trend나 Direction과 관련되어 있다면 Ordinal 구조를 고려하는 것이 중요할 수 있습니다.

반대로 순서가 없는 Data에 순서를 만들면 어떻게 될까?

더 큰 문제가 될 수 있습니다.

예를 들어 Region을:

1 = Korea

2 = China

3 = USA

로 Coding한 뒤:

“Region이 1단계 증가할 때 Outcome이 얼마나 변화하는가?”

라고 분석한다면 임의적인 Order를 Statistical Relationship처럼 사용하게 됩니다.

Coding을 바꾸면 결과도 달라질 수 있습니다.

이는 실제 Region 차이가 아니라 사용자가 임의로 지정한 숫자 구조의 영향일 수 있습니다.

Nominal Data에 존재하지 않는 순서를 강제로 부여하는 것은 분석 결과를 왜곡할 수 있습니다.

숫자로 Coding된 Category를 발견하면 무엇부터 확인해야 할까?

Dataset에:

0, 1, 2, 3

같은 값이 있다고 가정해보겠습니다.

바로 Continuous Variable이라고 판단하지 말고 다음을 확인해야 합니다.

1. 각 숫자의 실제 의미는 무엇인가?

Category Label인가?

2. Category 사이에 자연스러운 Order가 있는가?

없으면 Nominal일 가능성이 높습니다.

3. Order는 있지만 Distance도 의미 있는가?

Order만 있다면 Ordinal일 수 있습니다.

4. 숫자의 실제 차이가 Quantity를 의미하는가?

그렇다면 Quantitative Variable을 고려할 수 있습니다.

Data Dictionary가 중요한 이유

Nominal과 Ordinal을 정확히 구분하려면 Variable Definition을 알아야 합니다.

예를 들어 Dataset에:

SEV

라는 Variable이 있고 값이:

1

2

3

으로 되어 있다고 가정해보겠습니다.

Data Dictionary를 확인했더니:

1 = Mild

2 = Moderate

3 = Severe

라고 정의되어 있다면 Ordinal 구조를 파악할 수 있습니다.

반대로:

1 = Neurology

2 = Cardiology

3 = Oncology

라면 숫자는 동일해 보여도 Nominal입니다.

Measurement Scale은 데이터 파일의 숫자만 보고 결정하는 것이 아니라 Variable Definition을 함께 확인해야 합니다.

SAS Format이 Category의 의미를 보여줄 수 있다

SAS에서는 Numeric Code에 Format을 적용하여 사람이 이해하기 쉬운 Category Label을 표시할 수 있습니다.

첨부 교재에서도 Unsafe Variable에 대해:

0 = Average or Above

1 = Below Average

라는 User-Defined Format을 적용합니다.

이 구조는 중요한 점을 보여줍니다.

내부 Stored Value는:

0 / 1

이어도 화면에는:

Average or Above / Below Average

로 보일 수 있습니다.

즉:

Stored Value

Displayed Category

를 구분해야 합니다.

Format을 바꾸면 실제 Data도 바뀔까?

일반적으로 Display Format과 Stored Value는 구분해야 합니다.

예를 들어:

Stored Value = 1

Format Label = Below Average

라고 하면 화면에 Label이 표시될 수 있습니다.

하지만 Value 자체가 문자 "Below Average"로 바뀌었다고 단정하면 안 됩니다.

이 차이를 이해하면 SAS Output과 Coding을 해석하는 데 도움이 됩니다.

Category Label을 꼭 확인해야 하는 이유

통계 Output에서 10만 보인다면 어떤 Group이 무엇을 의미하는지 혼동할 수 있습니다.

예를 들어:

1 = Survived

0 = Died

인지,

1 = Died

0 = Survived

인지에 따라 Interpretation이 완전히 반대가 됩니다.

특히 Logistic Regression에서는 Event Category가 무엇인지 중요하기 때문에 단순 Coding Number만 기억하는 것은 위험할 수 있습니다.

Ordinal Category의 방향도 확인해야 한다

예를 들어 Functional Status가:

1 = Excellent

2 = Good

3 = Poor

4 = Very Poor

라고 Coding되었다면 숫자가 증가할수록 상태가 악화됩니다.

반대로:

1 = Very Poor

2 = Poor

3 = Good

4 = Excellent

이라면 숫자가 증가할수록 상태가 좋아집니다.

둘 다 Ordinal이지만 Direction이 반대입니다.

따라서 Ordinal Variable을 분석할 때는:

Higher Score = Better?

또는

Higher Score = Worse?

를 반드시 확인해야 합니다.

Missing Code를 Category로 오해하면 어떤 일이 생길까?

Categorical Data에서는 Missing을 특정 숫자로 Coding하는 경우가 있습니다.

예:

1 = Mild

2 = Moderate

3 = Severe

9 = Unknown

여기서 9를 실제 Severity Category처럼 분석하면:

Severe < Unknown

이라는 잘못된 순서가 만들어질 수 있습니다.

따라서 Special Code는 분석 전에 확인해야 합니다.

예를 들어:

  • Unknown
  • Not Applicable
  • Not Done
  • Missing

등은 실제 Clinical 또는 Statistical Category와 다를 수 있습니다.

Category를 합칠 때도 Order가 중요할까?

그렇습니다.

예를 들어 Satisfaction이:

1 = Very Dissatisfied

2 = Dissatisfied

3 = Neutral

4 = Satisfied

5 = Very Satisfied

일 때 다음처럼 결합할 수 있습니다.

Negative

1 + 2

Neutral

3

Positive

4 + 5

이 구조는 원래 Order를 어느 정도 유지합니다.

하지만:

1 + 5

를 하나의 Category로 묶는다면 원래 Ordinal Structure가 크게 달라질 수 있습니다.

따라서 Category Collapsing도 Measurement Meaning을 고려해야 합니다.

Category를 너무 많이 합치면 정보가 줄어든다

Ordinal Variable이 5개 Level을 가지고 있는데 이를:

Low

High

두 Category로만 바꾸면 분석이 단순해질 수 있습니다.

하지만 원래 존재했던 중간 단계 정보가 사라집니다.

예를 들어:

1, 2 → Low

3, 4, 5 → High

로 바꾸면 3과 5의 차이가 사라집니다.

따라서 Category를 합치는 것은 단순한 Data Cleaning이 아니라 정보 구조를 변경하는 분석 결정일 수 있습니다.

Ordinal을 Nominal로 분석하면 무조건 잘못일까?

그렇게 단정할 수는 없습니다.

Statistical Method와 Research Question에 따라 Ordinal Variable을 일반 Categorical Predictor로 사용할 수도 있습니다.

그 경우 각 Category를 별도의 Level로 비교할 수 있습니다.

다만 그렇게 하면 Ordinal Variable에 존재하는 순서 정보를 Model에서 직접 활용하지 않을 수 있습니다.

따라서 중요한 질문은:

“이 분석에서 Category Order가 중요한가?”

입니다.

Nominal을 Ordinal처럼 분석하는 것이 더 위험한 이유

Ordinal을 Nominal처럼 분석하면 정보 효율성 문제가 생길 수 있지만, Nominal에 존재하지 않는 순서를 가정하면 잘못된 구조를 Model에 넣을 수 있습니다.

예를 들어 Department를:

1 = Marketing

2 = Finance

3 = HR

라고 Coding한 뒤 Continuous Predictor로 사용하는 경우입니다.

이 Model은 숫자의 순서와 거리에서 의미를 찾으려고 할 수 있습니다.

하지만 Coding을:

1 = HR

2 = Marketing

3 = Finance

로 바꾸면 다른 Pattern이 만들어질 수 있습니다.

Category 자체는 전혀 바뀌지 않았는데 결과가 달라진다면 Coding을 Quantitative Information처럼 잘못 사용하고 있는지 확인해야 합니다.

Bar Chart에서 Nominal과 Ordinal은 어떻게 다를까?

두 Variable 모두 Bar Chart로 표현할 수 있습니다.

하지만 Category 배치 방식에 차이가 있을 수 있습니다.

Nominal에서는:

Korea / USA / China

같은 Category 순서를 Frequency 크기나 Alphabetical Order 등으로 정렬할 수 있습니다.

반면 Ordinal에서는:

Mild → Moderate → Severe

처럼 본래 의미 있는 순서를 유지하는 것이 중요합니다.

이를:

Severe → Mild → Moderate

처럼 임의로 배치하면 Data의 Order Structure를 이해하기 어려워질 수 있습니다.

Frequency Table에서도 Category 순서를 확인해야 한다

Ordinal Variable의 Frequency Table에서는 순서를 유지하면 Distribution을 훨씬 쉽게 파악할 수 있습니다.

예를 들어:

SeverityN
Mild25
Moderate60
Severe15

처럼 출력하면 한눈에 Distribution을 이해할 수 있습니다.

하지만 Alphabetical Order 등으로 의미 없는 순서로 표시하면 Ordinal Pattern을 파악하기 어려울 수 있습니다.

두 Ordinal Variable 사이 Association은 어떻게 생각할까?

두 Variable 모두 Order가 있다면 단순히 Category가 관련되어 있는지를 넘어 한 Variable이 증가할수록 다른 Variable도 특정 방향으로 변하는가라는 질문을 할 수 있습니다.

예를 들어:

Disease Severity

Mild → Moderate → Severe

Functional Impairment

Low → Medium → High

가 있다고 가정해보겠습니다.

연구 질문은 단순히:

“두 Variable이 관련되어 있는가?”

뿐 아니라:

“Severity가 증가할수록 Impairment도 증가하는 경향이 있는가?”

가 될 수 있습니다.

이것이 Ordinal 정보가 Statistical Analysis에 추가적인 의미를 제공하는 이유입니다.

SAS에서 Categorical Data를 분석하기 전에 무엇을 확인할까?

Dataset에서 Categorical Variable을 발견하면 다음 순서로 확인하는 것이 좋습니다.

Variable 확인

Category 정의 확인

순서 존재 여부 확인

Nominal / Ordinal 결정

Coding 확인

Reference / Direction 확인

Frequency 확인

Missing / Unexpected Category 확인

Statistical Method 선택

Categorical Analysis의 첫 단계는 Procedure를 선택하는 것이 아니라 Category의 의미와 순서를 정확히 이해하는 것입니다.

Unexpected Category를 확인해야 하는 이유

예를 들어 Region은 원래:

Asia

North America

두 Category만 있어야 한다고 가정해보겠습니다.

Frequency Table을 만들었더니:

Asia

North America

Unknown

N America

같은 값이 발견될 수 있습니다.

이 경우 Typo, Formatting, Missing 처리 문제 등을 확인해야 합니다.

첨부 교재에서도 Categorical Variable에 대해 One-Way Frequency Table을 만든 뒤 unusual data values가 있는지 확인하는 Exercise를 제공합니다.

즉 Frequency Table은 단순한 Summary뿐 아니라 Data Quality 확인에도 사용할 수 있습니다.

Frequency가 0인 Category도 중요할까?

가능한 Category는 정의되어 있지만 실제 Dataset에서는 Observation이 하나도 없는 경우가 있을 수 있습니다.

예를 들어 Study Design에는:

Placebo

Low Dose

High Dose

세 Group이 있지만 특정 Subset에서는 High Dose가 0명일 수 있습니다.

이 경우 Model이나 Table Interpretation에 영향을 줄 수 있습니다.

따라서 Category Definition과 실제 Observed Category를 구분해서 확인하는 것이 중요합니다.

Nominal과 Ordinal의 전체 구조

지금까지 내용을 간단히 정리하면 다음과 같습니다.

Categorical Variable

Category 사이 Order가 있는가?

No

Nominal

예:

Region

Blood Type

Treatment Type

Vehicle Type

주요 정보:

Frequency

Percentage

Proportion

Mode

Yes

Ordinal

예:

Severity

Satisfaction

Risk Level

Size Category

주요 정보:

Frequency

Percentage

Order

Rank

Cumulative Structure

Median 등

하지만:

Equal Distance

는 보장되지 않습니다.

Ordinal Variable은 Nominal Variable이 가진 Category 정보에 순서 정보가 추가된 구조라고 이해하면 쉽습니다.

흔한 오해 정리

“숫자로 저장된 Category는 Continuous Variable이다”

아닙니다.

숫자는 Category Code일 수 있습니다.

“1, 2, 3으로 Coding되어 있으면 항상 Ordinal이다”

그렇지 않습니다.

Region이나 Treatment Type처럼 숫자에 Order가 없는 Nominal Variable일 수 있습니다.

“Nominal과 Ordinal은 모두 Categorical이므로 같은 방식으로 해석하면 된다”

둘 다 Categorical이지만 Ordinal에는 의미 있는 Order가 있습니다.

“Ordinal의 1→2와 2→3 차이는 동일하다”

그렇게 단정할 수 없습니다.

Ordinal은 순서를 보장하지만 동일한 Distance를 보장하지 않습니다.

“Nominal Variable에서도 평균을 계산하면 정보가 된다”

Category Code의 Mean은 일반적으로 의미 있는 Quantity를 표현하지 않을 수 있습니다.

“Ordinal Variable은 무조건 Continuous처럼 분석해야 한다”

아닙니다.

연구 질문과 Scale 특성에 따라 Categorical 또는 Ordinal 구조에 맞는 분석을 고려해야 합니다.

“Binary Variable은 무조건 Nominal이다”

분석 문맥에 따라 Nominal, Ordinal, Binary 성질을 함께 고려할 수 있습니다. 첨부 교재에서도 Unsafe를 이러한 방식으로 분류합니다.

“Reference Category가 있으면 Ordinal Variable이다”

아닙니다.

Reference Category는 비교 기준이고 Ordinal Order는 Variable 자체의 순서 구조입니다.

Nominal과 Ordinal을 어떻게 구분하면 쉬울까?

Category를 본 뒤 다음 질문 하나를 먼저 하면 됩니다.

“이 Category들을 가장 낮은 수준에서 가장 높은 수준까지 자연스럽게 정렬할 수 있는가?”

정렬할 수 없다면:

Nominal

일 가능성이 높습니다.

정렬할 수 있다면:

Ordinal

을 고려할 수 있습니다.

그리고 한 가지 질문을 추가해야 합니다.

“Category 사이의 차이가 동일한 크기를 의미하는가?”

Ordinal에서는 일반적으로 이것이 보장되지 않습니다.

따라서:

Category 존재

Order 존재

Distance는 불확실

이라는 구조가 Ordinal의 핵심입니다.

왜 이 차이를 먼저 이해해야 할까?

앞으로 SAS에서 Categorical Data를 분석하면 다음과 같은 개념들이 등장합니다.

One-Way Frequency

Category Distribution

Two-Way Table

Category Association

Chi-Square Test

Categorical Association

그리고 Response가 Categorical이라면:

Logistic Regression

으로도 연결될 수 있습니다.

Ordinal Data에서는 여기에 추가로 Category Order를 활용하는 분석을 고려할 수 있습니다.

따라서 Statistical Procedure를 배우기 전에 Nominal과 Ordinal의 구조를 명확하게 구분해야 합니다.

핵심 정리

Nominal과 Ordinal은 모두 Categorical Variable이지만 가장 중요한 차이는 Category 사이의 Order 존재 여부입니다.

Nominal Variable에서는:

Category

는 존재하지만

Logical Order

는 없습니다.

예를 들어 Region이나 Vehicle Type처럼 각 Category는 서로 다른 집단을 나타낼 뿐 크기나 순위를 의미하지 않습니다.

첨부 교재에서도 Beverage Type을 숫자로 Coding하더라도 논리적 순서가 없는 Nominal Variable로 설명합니다.

반면 Ordinal Variable에서는:

Category

Order

가 존재합니다.

예를 들어 Small → Medium → Large 또는 Mild → Moderate → Severe처럼 순서를 정의할 수 있습니다.

하지만 Category 사이의 거리가 동일하다고 보장되는 것은 아닙니다.

전체 구조를 정리하면 다음과 같습니다.

Categorical Variable

Order 없음

Nominal

또는

Order 있음

Ordinal

하지만 Equal Distance는 보장되지 않음

첨부 교재의 Safety Dataset에서도 TypeRegion은 Nominal, Size는 Ordinal로 구분되어 있으며, 이처럼 같은 Categorical Data라도 Measurement Scale에 따라 서로 다른 정보를 포함할 수 있습니다.

Nominal과 Ordinal을 구분하는 것은 단순히 Variable 이름을 분류하는 작업이 아니라, Data가 가지고 있는 정보를 얼마나 올바르게 Statistical Analysis에 반영할 것인지를 결정하는 과정입니다.

함께 읽으면 좋은 글

  • Measurement Scale의 중요성: 변수의 측정척도가 통계분석 방법을 결정하는 이유
  • Interval과 Ratio Scale의 차이: 연속형 변수에서 절대적 0이 중요한 이유
  • Predictor와 Response Variable의 구조: 설명변수와 반응변수의 역할 이해
  • 변수 유형과 통계모형의 관계: ANOVA·Regression·Logistic Regression 선택 기준
  • Descriptive Statistics의 목적: 본격적인 분석 전에 데이터를 진단해야 하는 이유

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Fundamental Statistical Concepts
  • Measurement Scales: Nominal and Ordinal Variables
  • Describing Categorical Data
  • One-Way and Two-Way Frequency Tables
  • Tests of Association

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.