본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

변수 유형과 통계모형의 관계: ANOVA·Regression·Logistic Regression 선택 기준

읽는 시간 약 57분

통계분석에서 가장 중요한 결정 중 하나는 어떤 Statistical Model을 사용할 것인가입니다.

SAS Enterprise Guide에는 ANOVA, Regression, Logistic Regression처럼 여러 분석 방법이 제공되지만, 메뉴에 존재한다고 해서 원하는 방법을 임의로 선택하면 되는 것은 아닙니다.

Model 선택은 기본적으로 다음 요소에서 시작합니다.

  • Response Variable이 어떤 Type인가?
  • Predictor Variable이 어떤 Type인가?
  • 연구 질문이 Group Difference를 보는 것인가?
  • Variable 사이 Relationship을 Modeling하려는 것인가?
  • Response가 Continuous인가 Categorical인가?

Statistical Model은 Software 메뉴에서 선택하는 것이 아니라 Response와 Predictor의 구조를 먼저 파악한 뒤 선택해야 합니다.

첨부 교재에서도 Statistical Modeling의 유형은 Response Variable과 Predictor Variable의 Measurement Level에 따라 달라진다고 설명하고, 이 조합에 따라 ANOVA, Ordinary Least Squares Regression, ANCOVA, Logistic Regression 등을 구분합니다.

Statistical Model이란 무엇인가?

Statistical Model은 Data에서 관찰되는 Pattern이나 Variable 사이의 관계를 수학적 구조로 표현하는 방법입니다.

예를 들어 다음 질문을 생각해보겠습니다.

Treatment Group에 따라 평균 Outcome이 다른가?

이를 Statistical Structure로 바꾸면:

Treatment

Predictor

Outcome

Response

입니다.

그리고 Treatment가 Categorical이고 Outcome이 Continuous라면 ANOVA와 연결될 수 있습니다.

반대로:

Age가 증가할수록 Outcome이 어떻게 변하는가?

라면:

Age

Continuous Predictor

Outcome

Continuous Response

Linear Regression

구조가 됩니다.

즉 Statistical Model은 Research Question을 Data 구조에 맞게 수학적으로 표현하는 방법입니다.

Model 선택에서 Response가 가장 먼저 중요한 이유

첨부 교재에서는 Statistical Model을 설명할 때 Response와 Predictor를 두 가지 핵심 Variable 유형으로 나눕니다.

Response는 Business나 Research에서 주된 관심 대상이며 Outcome 또는 Target Variable이라고도 설명합니다.

Predictor는 Response와 이론적으로 관련되어 있으며 Response 값을 설명하거나 예측하는 데 사용하는 Variable입니다.

따라서 Model 선택의 첫 질문은 다음과 같습니다.

“내 Response Variable은 Continuous인가, Categorical인가?”

이 질문 하나로 사용할 수 있는 Model의 큰 범위가 나뉩니다.

Continuous Response란 무엇인가?

Continuous Response는 숫자로 측정되고 값 사이의 차이가 의미 있는 Outcome입니다.

예를 들어:

  • Weight
  • Blood Pressure
  • Cognitive Score
  • Income
  • Test Score
  • Reaction Time

등이 있습니다.

예를 들어 Outcome Score가:

72

81

94

처럼 측정된다면 Continuous Response로 사용할 수 있습니다.

이 경우 Predictor Type에 따라:

  • ANOVA
  • OLS Regression
  • ANCOVA

같은 Model을 고려할 수 있습니다.

Categorical Response란 무엇인가?

Categorical Response는 Outcome이 Category로 표현되는 경우입니다.

예를 들어:

  • Success / Failure
  • Yes / No
  • Disease / No Disease
  • Survived / Died
  • Responder / Non-Responder

등입니다.

첨부 교재에서는 Categorical Response를 분석할 때 Predictor가 Categorical이든 Continuous이든 Categorical Data Analysis 또는 Logistic Regression과 연결합니다.

즉 Response Type이 Model Family를 결정하는 매우 중요한 기준입니다.

Predictor가 Categorical이면 무엇이 달라질까?

Categorical Predictor는 Observation을 Group으로 나누는 Variable입니다.

예를 들어:

Treatment

Placebo

Drug A

Drug B

처럼 구성되어 있다면 Category 사이의 Group Difference를 분석할 수 있습니다.

Response가 Continuous라면 질문은 다음과 같이 바뀝니다.

“Treatment Group에 따라 평균 Outcome이 다른가?”

즉:

Categorical Predictor

Continuous Response

ANOVA

구조가 됩니다.

첨부 교재의 Statistical Model Overview에서도 같은 조합을 ANOVA와 연결합니다.

ANOVA는 어떤 질문에 적합할까?

ANOVA는 여러 Group의 Population Mean이 같은지를 비교하는 데 사용하는 대표적인 분석 방법입니다.

예를 들어:

Fertilizer

A / B / C

Garlic Bulb Weight

라는 구조가 있다고 가정해보겠습니다.

Research Question은:

Fertilizer 종류에 따라 평균 Bulb Weight가 다른가?

입니다.

첨부 교재의 One-Way ANOVA에서도 Fertilizer에 따라 Garlic Bulb Weight 평균에 차이가 있는지를 분석하는 예제를 제공합니다.

전체 구조는:

Categorical Predictor

Group

Continuous Response

Mean Comparison

ANOVA

입니다.

Predictor가 두 Category뿐이면 ANOVA를 사용할 수 없을까?

그렇지 않습니다.

Group이 두 개라면 Two-Sample t-Test를 사용할 수 있고 One-Way ANOVA로도 동일한 Mean Difference 구조를 검정할 수 있는 상황이 있습니다.

첨부 교재에서도 Male과 Female의 평균 Monthly Credit Card Spending을 비교하는 문제에서 Two-Sample t-Test와 One-Way ANOVA 모두 사용할 수 있는 방법으로 제시합니다.

즉 두 Group에서는 t-Test와 ANOVA가 연결되는 부분이 있습니다.

하지만 Group 수가 늘어나면 ANOVA의 필요성이 더 명확해집니다.

Predictor가 Continuous이면 어떤 Model을 사용할까?

Predictor가 Continuous이고 Response도 Continuous라면 Ordinary Least Squares Regression, 즉 일반적인 Linear Regression을 고려할 수 있습니다.

예를 들어:

Age

Continuous Predictor

Blood Pressure

Continuous Response

라면 질문은 다음과 같습니다.

Age가 증가함에 따라 Blood Pressure가 어떻게 변하는가?

ANOVA가 Group Mean Difference를 비교한다면 Regression은 Predictor 값이 변화할 때 Response가 어떻게 변하는지를 Modeling합니다.

첨부 교재에서도:

Continuous Predictor

Continuous Response

OLS Regression

을 연결합니다.

Linear Regression의 기본 구조

가장 단순한 Linear Regression은 다음 형태입니다.

Predictor X

Response 변화 설명

Response Y

예를 들어:

Advertising Cost

Sales

라고 가정해보겠습니다.

Regression은 Advertising Cost가 1단위 증가할 때 Sales가 평균적으로 얼마나 변화하는지를 추정할 수 있습니다.

즉 ANOVA와 Regression의 차이를 다음처럼 생각할 수 있습니다.

ANOVA

Group A

Group B

Group C

Mean 비교

Regression

X 값 변화

Y 값 변화량 추정

ANOVA와 Regression은 완전히 다른 세계일까?

완전히 분리된 개념으로 생각할 필요는 없습니다.

두 Model 모두 Continuous Response를 설명하는 Linear Model Framework에서 이해할 수 있습니다.

차이는 Predictor의 형태입니다.

ANOVA

Categorical Predictor

Regression

Continuous Predictor

입니다.

첨부 교재에서도 두 분석을 하나의 Statistical Model Overview 안에서 Predictor Type 차이로 구분하고 있습니다.

ANOVA와 Regression을 서로 완전히 독립된 분석법으로 외우기보다 Continuous Response를 서로 다른 Predictor 구조로 설명하는 방법으로 이해하면 더 체계적입니다.

Categorical과 Continuous Predictor가 함께 있으면 어떻게 할까?

실제 Data에서는 한 종류의 Predictor만 있는 경우보다 여러 형태의 Predictor가 함께 존재하는 경우가 많습니다.

예를 들어:

Treatment

Categorical

Baseline Score

Continuous

Outcome

Continuous

형태입니다.

첨부 교재의 Model Overview에서는 이 구조를 ANCOVA(Analysis of Covariance)와 연결합니다.

즉:

Continuous Response

Categorical Predictor

Continuous Predictor

ANCOVA

입니다.

ANCOVA는 왜 필요한가?

예를 들어 Treatment Group의 Outcome을 비교한다고 가정해보겠습니다.

하지만 각 Patient의 Baseline Score가 다릅니다.

단순하게 Treatment Group 평균만 비교하면 Baseline의 차이를 고려하지 않을 수 있습니다.

이때:

Treatment

Group Effect

Baseline

Continuous Covariate

Outcome

을 Modeling할 수 있습니다.

이렇게 Categorical Predictor와 Continuous Predictor를 함께 고려하는 구조가 ANCOVA입니다.

ANCOVA와 Multiple Regression은 관계가 있을까?

있습니다.

ANCOVA 역시 Linear Model 관점에서 Categorical Predictor와 Continuous Predictor를 함께 포함하는 형태로 이해할 수 있습니다.

예를 들어:

Outcome

=

Treatment

Age

Baseline Score

와 같은 Model을 생각할 수 있습니다.

Treatment는 Categorical Predictor이고 Age와 Baseline Score는 Continuous Predictor입니다.

따라서 실제 Statistical Modeling에서는 ANOVA, ANCOVA, Regression이 서로 연결된 개념으로 이해될 수 있습니다.

Response가 Categorical이면 왜 Linear Regression을 그대로 쓰지 않을까?

Binary Response를 생각해보겠습니다.

예:

0 = Failure

1 = Success

여기에 일반적인 Linear Regression을 적용한다고 가정하면 Predicted Value가:

-0.2

1.3

처럼 가능한 Category 범위를 벗어날 수 있습니다.

또 Error Structure 역시 Continuous Response Model과 잘 맞지 않을 수 있습니다.

따라서 Binary Categorical Response에는 해당 구조에 맞는 Model이 필요합니다.

대표적인 방법이 Logistic Regression입니다.

Logistic Regression은 어떤 질문에 적합할까?

예를 들어:

Age와 Treatment가 Patient Survival과 관련이 있는가?

라는 질문이 있습니다.

Response는:

Survival

Died / Survived

Binary Categorical

Predictor는:

Age

Gender

Treatment

등이 될 수 있습니다.

이때 Logistic Regression을 사용할 수 있습니다.

첨부 교재에서도 Categorical Response인 경우 Predictor가 Categorical, Continuous 또는 둘의 조합이어도 Logistic Regression을 적용할 수 있는 구조를 제시합니다.

Logistic Regression에서는 무엇을 Modeling할까?

Linear Regression은 Continuous Response의 평균적 변화를 Modeling합니다.

반면 Logistic Regression에서는 특정 Event가 발생할 Probability와 연결된 구조를 Modeling합니다.

예를 들어:

Event

Survived

라고 정의하면:

Age

Gender

Class

등의 Predictor가 Survival Probability 또는 Odds와 어떻게 관련되는지 분석할 수 있습니다.

따라서:

Continuous Response

Linear Model

Categorical Response

Logistic Model

을 구분해야 합니다.

숫자 0과 1로 되어 있으면 Continuous Response일까?

아닙니다.

이 부분은 매우 중요합니다.

예를 들어:

0 = Died

1 = Survived

라면 SAS Dataset에서는 Numeric Variable일 수 있습니다.

하지만 Statistical Meaning은 Binary Categorical Response입니다.

따라서 단순히 Numeric Type이라는 이유만으로 Linear Regression을 선택하면 안 됩니다.

Software의 Data Type보다 Measurement Scale과 Response Meaning이 Model 선택에 더 중요합니다.

Response가 Nominal Category 여러 개인 경우에는?

예를 들어 Response가:

  • Product A
  • Product B
  • Product C

처럼 두 개보다 많은 Nominal Category를 가진다면 Binary Logistic Regression과는 다른 형태의 Categorical Model이 필요할 수 있습니다.

첨부 교재의 Model Overview는 Categorical Response를 넓게 Categorical Data Analysis 또는 Logistic Regression 영역으로 분류합니다.

실제 Model 선택에서는 Category 수와 구조를 더 구체적으로 확인해야 합니다.

Response가 Ordinal이면 어떻게 달라질까?

예를 들어 Response가:

Mild

Moderate

Severe

라면 Category이면서 Order가 존재합니다.

이 경우 단순 Binary Logistic Regression과 동일하게 처리할 수는 없습니다.

Ordinal Information을 활용할 수 있는 Model을 고려할 수 있습니다.

즉 Categorical Response라고 해도 다음 구조를 추가로 확인해야 합니다.

Binary인가?

Nominal Multicategory인가?

Ordinal인가?

따라서 “Categorical이면 Logistic Regression”이라고 지나치게 단순화하면 안 됩니다.

Predictor가 Nominal인지 Ordinal인지도 중요할까?

중요할 수 있습니다.

예를 들어 Predictor가:

Treatment

Placebo / A / B

라면 Nominal Factor일 수 있습니다.

반면:

Severity

Mild / Moderate / Severe

라면 Ordinal Predictor일 수 있습니다.

둘 다 Categorical Predictor로 Model에 포함할 수 있지만 Ordinal Variable에는 추가적인 Order Information이 있습니다.

그 정보를 Model에서 어떻게 사용할지는 Research Question에 따라 달라질 수 있습니다.

Continuous Predictor를 Category로 바꾸면 Model도 달라질 수 있다

예를 들어 Age를 원래 Continuous로 사용한다고 가정해보겠습니다.

Age

Continuous

Regression Coefficient

Age 1년 증가에 따른 Response 변화

그런데 Age를:

<65

65–74

≥75

로 나누면 Categorical Predictor가 됩니다.

이 경우:

Age Group

Group Difference

형태로 해석하게 됩니다.

즉 같은 원래 Variable이라도 Coding 방식이 Model과 Interpretation에 영향을 줍니다.

Category로 나누는 것이 항상 좋은 것은 아니다

Continuous Predictor를 Category로 변환하면 분석이 이해하기 쉬워질 수 있습니다.

하지만 정보가 줄어듭니다.

예를 들어 Age를:

<65

≥65

로 나누면:

20세와 64세

가 같은 Category가 되고,

65세와 90세

도 같은 Category가 됩니다.

원래의 세밀한 Numeric Information을 잃는 것입니다.

따라서 단순히 Model을 쉽게 만들기 위해 무조건 Category로 변환하는 것은 신중해야 합니다.

Predictor가 여러 개면 어떤 Model이 될까?

예를 들어 Response가 Continuous이고 Predictor가 다음과 같다고 가정해보겠습니다.

  • Age
  • Weight
  • Baseline Score

모두 Continuous입니다.

이 경우 Multiple Linear Regression 구조를 사용할 수 있습니다.

Model은 개념적으로:

Outcome

=

Age

Weight

Baseline Score

형태가 됩니다.

각 Predictor의 Effect를 다른 Predictor를 함께 고려하면서 추정할 수 있습니다.

Categorical Predictor도 Multiple Regression에 들어갈 수 있을까?

가능합니다.

Regression Model 안에서 Categorical Predictor를 Indicator Variable이나 Parameterization 구조를 통해 포함할 수 있습니다.

예를 들어:

Outcome

=

Age

Treatment

Gender

같은 Model입니다.

Age는 Continuous,

Treatment와 Gender는 Categorical입니다.

이 구조는 넓은 의미에서 Multiple Regression / ANCOVA Framework로 이해할 수 있습니다.

Model 선택은 Variable Type만 보면 끝날까?

아닙니다.

Variable Type은 중요한 출발점이지만 최종 Model 선택에는 다른 조건도 고려해야 합니다.

예를 들어:

  • Study Design
  • Number of Groups
  • Independence
  • Repeated Measures
  • Distribution
  • Sample Size
  • Missing Data
  • Model Assumption

등입니다.

Response와 Predictor Type은 Model Selection의 첫 번째 필터이지 최종 결정의 전부는 아닙니다.

Distribution은 왜 중요할까?

예를 들어 Response가 Continuous라고 가정해보겠습니다.

Continuous라는 이유만으로 항상 Standard Linear Model이 적절한 것은 아닙니다.

Response Distribution이 매우 Skewed하거나 Extreme Value가 많거나 특정 구조를 가진다면 Model Assumption을 확인해야 합니다.

첨부 교재에서도 Inferential Analysis 전에 Data를 탐색하고 Distribution을 확인하는 과정을 강조합니다.

즉:

Measurement Scale

Model 후보 결정

그리고:

Distribution / Assumption

Model 적합성 평가

라는 두 단계가 필요합니다.

ANOVA의 Assumption도 확인해야 할까?

그렇습니다.

첨부 교재의 One-Way ANOVA Chapter에서는 ANOVA를 이용해 Population Mean 차이를 검정하는 것뿐 아니라 ANOVA Assumption을 검증하는 것도 Objective로 제시합니다.

따라서:

Categorical Predictor

Continuous Response

라는 이유만으로 ANOVA를 무조건 실행하면 끝나는 것은 아닙니다.

분석 가정도 확인해야 합니다.

Regression도 Relationship 형태를 먼저 확인해야 한다

Continuous Predictor와 Continuous Response라고 해서 반드시 Linear Relationship이 존재하는 것은 아닙니다.

예를 들어:

Age

Outcome

관계가 Curved Pattern일 수도 있습니다.

첨부 교재의 Regression Chapter에서도 Simple Regression에 앞서 Exploratory Data Analysis를 배치하고 Scatter Plot과 Correlation으로 두 Continuous Variable의 관계를 먼저 탐색하도록 구성합니다.

즉 Model 전에 Data Pattern을 확인하는 과정이 중요합니다.

Scatter Plot을 먼저 보는 이유

Continuous Predictor와 Response가 있다면 Scatter Plot으로 다음을 확인할 수 있습니다.

  • Direction
  • Linearity
  • Outlier
  • Cluster
  • Nonlinear Pattern

예를 들어 두 Variable의 Scatter Plot이 U자형이라면 일반적인 Straight-Line Regression 하나로 Relationship을 충분히 표현하지 못할 수 있습니다.

따라서:

Continuous + Continuous

즉시 Regression

이 아니라:

Continuous + Continuous

Explore Relationship

Model 선택

이 더 적절한 흐름입니다.

Correlation과 Regression은 같은 것일까?

아닙니다.

두 Continuous Variable의 관계를 다룬다는 점에서는 연결되지만 역할이 다릅니다.

Correlation

Association의 Direction과 Strength를 요약

Regression

Predictor를 이용해 Response의 평균적 변화 구조를 Modeling

또 Correlation에서는 두 Variable의 역할이 대칭적인 반면 Regression에서는 Predictor와 Response가 구분됩니다.

따라서 Research Question이 무엇인지 확인해야 합니다.

t-Test와 ANOVA는 어떻게 선택할까?

Continuous Response를 Categorical Predictor로 비교하는 상황을 생각해보겠습니다.

Predictor Level이 두 개라면:

Two-Sample t-Test

를 사용할 수 있습니다.

여러 Group이라면:

One-Way ANOVA

가 대표적인 방법입니다.

첨부 교재에서도 Male과 Female의 평균 Spending 비교에 Two-Sample t-Test와 One-Way ANOVA가 모두 가능한 방법으로 제시됩니다.

즉 두 분석은 Group Mean Comparison이라는 공통 구조를 가집니다.

왜 Group이 많으면 t-Test를 반복하면 안 될까?

예를 들어 Group이:

A

B

C

세 개라고 가정해보겠습니다.

다음 비교를 할 수 있습니다.

A vs B

A vs C

B vs C

각각 t-Test를 반복하면 Multiple Testing으로 인해 전체 Type I Error가 증가할 수 있습니다.

이 때문에 여러 Group Mean을 동시에 비교할 때 ANOVA가 중요합니다.

이 주제는 31번 글에서 더 자세히 다룰 예정입니다.

Response가 Binary인데 Predictor가 Categorical이면?

예를 들어:

Treatment

Placebo / Drug

Predictor = Categorical

그리고:

Responder

Yes / No

Response = Binary Categorical

이라면 Logistic Regression 또는 Categorical Table Analysis를 고려할 수 있습니다.

첨부 교재에서도:

Categorical Predictor

Categorical Response

Contingency Table Analysis 또는 Logistic Regression

으로 연결합니다.

Contingency Table Analysis는 언제 사용할까?

두 Categorical Variable 사이 Association을 확인할 때 Two-Way Table을 만들 수 있습니다.

예를 들어:

Treatment

×

Responder Status

입니다.

Table에서 각 Combination의 Frequency를 확인하고 Chi-Square Test 등으로 Association을 평가할 수 있습니다.

이 접근은 복잡한 Predictor Adjustment가 필요하지 않은 기본적인 Categorical Relationship을 이해하는 데 유용합니다.

Logistic Regression이 더 확장된 분석인 이유

Logistic Regression에서는 여러 Predictor를 동시에 포함할 수 있습니다.

예를 들어:

Responder

=

Treatment

Age

Gender

Baseline Score

처럼 구성할 수 있습니다.

이 경우 Treatment와 Response의 단순 Association만 보는 것이 아니라 여러 Predictor를 함께 고려할 수 있습니다.

따라서 Categorical Outcome Analysis를 더 확장할 수 있습니다.

Predictor와 Response의 조합을 표처럼 기억해보자

첨부 교재의 Statistical Model Overview를 간단히 재구성하면 다음과 같습니다.

Response = Continuous

Predictor = Categorical

ANOVA

Predictor = Continuous

OLS Regression

Predictor = Categorical + Continuous

ANCOVA

Response = Categorical

Predictor = Categorical

Contingency Table Analysis / Logistic Regression

Predictor = Continuous

Logistic Regression

Predictor = Categorical + Continuous

Logistic Regression

이 구조는 교재에서 반복적으로 제시되는 핵심 Model Selection Framework입니다.

SAS에서 Model을 선택하기 전에 무엇을 적어보면 좋을까?

실제 분석을 시작하기 전에 다음과 같은 작은 표를 만들어 볼 수 있습니다.

항목
Research QuestionTreatment가 Outcome에 영향을 주는가?
ResponseOutcome Score
Response TypeContinuous
PredictorTreatment
Predictor TypeCategorical
Candidate ModelANOVA

또 다른 예:

항목
Research QuestionAge와 Treatment가 Survival과 관련되는가?
ResponseSurvival
Response TypeBinary Categorical
PredictorsAge, Treatment
Predictor TypeContinuous + Categorical
Candidate ModelLogistic Regression

이렇게 정리하면 SAS Menu를 열기 전에 Model의 논리를 먼저 확인할 수 있습니다.

“어떤 SAS Task를 사용할까?”보다 먼저 물어야 할 질문

초보자는 다음 순서로 접근하기 쉽습니다.

SAS 실행

ANOVA Menu 찾기

Variable 넣기

하지만 더 좋은 순서는:

Research Question

Response 결정

Response Type 확인

Predictor 결정

Predictor Type 확인

Model 후보 선택

Assumption 확인

SAS Task 실행

입니다.

SAS는 선택한 Model을 계산해주는 도구이고, 어떤 Model이 적절한지를 결정하는 것은 분석자의 역할입니다.

Model이 실행되었다고 선택이 올바른 것은 아니다

예를 들어 Categorical Code를 Numeric Predictor로 잘못 넣었다고 가정해보겠습니다.

Region:

1 = Korea

2 = China

3 = USA

를 Continuous Predictor처럼 Regression에 넣어도 SAS는 계산 자체를 수행할 수 있습니다.

하지만 Model은:

Region 1단계 증가

라는 실제로 존재하지 않는 Quantitative Relationship을 가정할 수 있습니다.

따라서:

Software Execution Success

Statistical Model Validity

는 별개의 문제입니다.

Variable Type 오류가 Model 전체를 바꿀 수 있다

예를 들어 Response가:

0 = No

1 = Yes

인데 이를 Continuous라고 잘못 판단하면 Linear Regression을 선택할 수 있습니다.

반대로 실제 Continuous Score를 임의로 Category로 변환하면 Logistic Model을 사용하게 될 수 있습니다.

즉 Measurement Scale을 잘못 판단하면 단순 Option 하나가 아니라 Model Family 자체가 바뀔 수 있습니다.

Data Coding을 반드시 확인해야 하는 이유

Dataset에서 Variable 값이:

1

2

3

으로 보인다고 가정해보겠습니다.

이것이:

Case A

1 = Korea

2 = China

3 = USA

라면 Nominal입니다.

Case B

1 = Mild

2 = Moderate

3 = Severe

라면 Ordinal입니다.

Case C

실제 측정값 1, 2, 3

이라면 Quantitative일 수 있습니다.

숫자는 같지만 Statistical Meaning은 완전히 다릅니다.

따라서 Model 선택 전에 Data Dictionary와 Coding을 확인해야 합니다.

Outcome을 Category로 바꾸면 Model Selection이 달라진다

예를 들어 Cognitive Score가 Continuous Response라고 가정해보겠습니다.

그대로 사용하면:

Linear Model

을 고려할 수 있습니다.

하지만 Score를 기준으로:

Responder

Non-Responder

로 변환하면 Response는 Binary Categorical이 됩니다.

이 경우:

Logistic Regression

과 같은 Model을 고려하게 됩니다.

Response Definition 자체가 Statistical Question과 Model을 바꿀 수 있습니다.

같은 Data에서도 서로 다른 Model이 가능한 이유

같은 Dataset이라도 Research Question이 다르면 Model도 달라집니다.

예를 들어 다음 Variable이 있습니다.

  • Treatment
  • Age
  • Outcome Score
  • Responder

질문 1

Treatment에 따라 Outcome Score가 다른가?

ANOVA

질문 2

Age가 Outcome Score와 관련되는가?

Regression

질문 3

Treatment와 Age를 보정하면서 Outcome Score를 분석하고 싶은가?

ANCOVA / Multiple Regression

질문 4

Treatment와 Age가 Responder 여부와 관련되는가?

Logistic Regression

즉 Dataset이 Model을 하나로 결정하는 것이 아닙니다.

Research Question과 Variable Role의 조합이 Model을 결정합니다.

Simple Model과 Multiple Model의 차이

Predictor 하나만 사용하는 Model을 Simple Model이라고 할 수 있습니다.

예:

Outcome

=

Age

반면 여러 Predictor를 사용하면:

Outcome

=

Age

Treatment

Baseline

같은 Multiple Model이 됩니다.

Predictor가 늘어날수록 더 다양한 관계를 동시에 고려할 수 있지만 Model Complexity도 증가합니다.

Predictor를 많이 넣으면 항상 더 정확할까?

아닙니다.

Predictor를 과도하게 포함하면 다음 문제가 발생할 수 있습니다.

  • Overfitting
  • Unstable Estimate
  • Multicollinearity
  • Interpretation 어려움
  • Data Requirement 증가

따라서 Model Building에서는 필요한 Predictor를 이론적·통계적으로 판단해야 합니다.

뒤에서 Forward, Backward, Stepwise Selection도 다룰 예정입니다.

Automatic Model Selection만 믿어도 될까?

SAS에서는 다양한 Variable Selection Method를 사용할 수 있습니다.

하지만 Software가 자동으로 선택한 Model이 반드시 가장 과학적으로 적절한 Model이라는 의미는 아닙니다.

예를 들어 중요한 Confounder가 p-value 기준 때문에 제외될 수 있습니다.

또 Sample에 우연히 잘 맞는 Variable이 선택될 수도 있습니다.

따라서:

Automated Selection

은 분석 보조 도구이지

Research Judgment

를 대체할 수 없습니다.

Statistical Significance만으로 Model을 선택하면 안 되는 이유

Model을 비교할 때 p-value가 작은 Predictor만 남기고 싶은 유혹이 있을 수 있습니다.

하지만 다음도 중요합니다.

  • Effect Size
  • Confidence Interval
  • Model Fit
  • Scientific Plausibility
  • Study Design
  • Clinical / Practical Meaning

따라서:

p < 0.05

=

중요한 Predictor

라고 자동으로 연결하면 안 됩니다.

Sample Size도 Model Selection에 영향을 줄까?

그렇습니다.

복잡한 Model일수록 더 많은 Parameter를 추정해야 합니다.

예를 들어 Sample이 매우 작은데 Predictor를 수십 개 포함하면 Stable Model을 만들기 어려울 수 있습니다.

특히 Categorical Predictor에 Level이 많으면 많은 Parameter가 필요할 수 있습니다.

따라서 Model Complexity와 Sample Size를 함께 고려해야 합니다.

Rare Category가 Logistic Regression에 영향을 줄 수 있을까?

가능합니다.

Binary Response나 Categorical Predictor에서 특정 Combination의 Observation이 매우 적으면 Parameter Estimate가 불안정할 수 있습니다.

예를 들어:

Treatment B에서 Event = Yes가 1명뿐

이라면 Effect를 안정적으로 추정하기 어려울 수 있습니다.

SAS가 Model을 실행한다고 해서 Estimate가 항상 안정적인 것은 아닙니다.

Missing Data도 Model마다 다르게 영향을 줄 수 있다

Model에 Predictor를 추가할수록 Missing Value 때문에 실제 분석에 포함되는 Observation 수가 줄어들 수 있습니다.

예를 들어:

Model A

Age만 포함

N = 1,000

Model B

Age + Weight + Baseline

N = 850

이 될 수 있습니다.

따라서 Model Comparison 시 Number of Observations Used를 확인해야 합니다.

같은 Predictor라도 Model에 따라 해석이 달라질 수 있다

Age라는 Predictor를 생각해보겠습니다.

Linear Regression

Coefficient:

Age 1년 증가에 따른 평균 Outcome 변화

Logistic Regression

Coefficient / Odds Ratio:

Age 증가와 Event Odds의 변화 관계

즉 Variable은 같아도 Response Type과 Model에 따라 Parameter Interpretation이 달라집니다.

Categorical Predictor의 Reference Level도 확인해야 한다

Treatment가:

Placebo

Drug A

Drug B

라면 Regression이나 Logistic Regression에서 특정 Level이 Reference가 될 수 있습니다.

예를 들어 Placebo가 Reference이면 Drug A와 Drug B Effect를 Placebo와 비교해 해석할 수 있습니다.

Reference를 Drug B로 바꾸면 Coefficient 표현은 달라집니다.

하지만 underlying Data Relationship 자체가 바뀌는 것은 아닙니다.

Interaction이 있으면 단순 Model보다 복잡해진다

예를 들어 Treatment Effect가 Gender에 따라 다르다고 가정해보겠습니다.

Model에:

Treatment

Gender

만 넣으면 각각의 Main Effect를 고려합니다.

하지만:

Treatment × Gender

Interaction을 추가하면:

Treatment Effect

Gender Level에 따라 달라질 수 있음

을 Modeling합니다.

이 경우 단순 Coefficient 하나만 해석하기 어려워질 수 있습니다.

Interaction은 이후 Two-Way ANOVA와 Regression에서 더 자세히 다룰 예정입니다.

One-Way와 Two-Way ANOVA는 무엇이 다를까?

One-Way ANOVA

Categorical Predictor 하나

Continuous Response

Two-Way ANOVA

Categorical Predictor 두 개

Continuous Response

예를 들어:

Treatment

Outcome

이면 One-Way ANOVA 구조입니다.

하지만:

Treatment

Gender

Outcome

이라면 Two-Way ANOVA 구조를 고려할 수 있습니다.

두 Factor 사이 Interaction도 분석할 수 있습니다.

Simple Regression과 Multiple Regression의 차이

Simple Linear Regression

Predictor 하나

Continuous Response

Multiple Linear Regression

Predictor 여러 개

Continuous Response

예를 들어:

Outcome

=

Age

는 Simple Regression이고,

Outcome

=

Age

Weight

Baseline Score

는 Multiple Regression입니다.

이후 43번과 46번 글에서 각각 더 자세히 다룰 예정입니다.

Logistic Regression에도 Predictor를 여러 개 넣을 수 있다

Logistic Regression 역시 Predictor 하나만 사용하는 분석은 아닙니다.

첨부 교재의 Logistic Regression 예제에서는 Survival을 Response로 하고 Age, Gender, Class 및 Interaction을 Model에 포함하는 구조가 제시됩니다.

즉:

Categorical Response

라고 해서 단순 Cross Tabulation만 가능한 것이 아니라 여러 Predictor를 동시에 Modeling할 수 있습니다.

Statistical Model 선택의 기본 의사결정 구조

Model 선택을 단순화하면 다음 순서를 사용할 수 있습니다.

Research Question

Response Variable 결정

Response Type?

Continuous

Predictor Type?

Categorical

ANOVA

Continuous

OLS Regression

Categorical + Continuous

ANCOVA / Multiple Linear Model

Categorical

Predictor Type과 관계없이

Categorical Data Analysis / Logistic Regression Framework 고려

이는 첨부 교재에서 제시한 기본 Statistical Model 구조와 같습니다.

하지만 이 표만 외우면 충분할까?

아닙니다.

이 표는 첫 번째 Model 후보를 선택하는 기본 Framework입니다.

그 다음에는 다음을 확인해야 합니다.

Data Distribution

Study Design

Independence

Model Assumption

Sample Size

Outlier

Missing Data

Interaction

즉 Variable Type은 Model Selection의 시작점입니다.

Model Selection과 Model Validation은 다르다

두 과정을 구분해야 합니다.

Model Selection

어떤 종류의 Statistical Model을 사용할 것인가?

예:

ANOVA

Regression

Logistic Regression

Model Validation

선택한 Model이 실제 Data에 적절한가?

예:

Residual

Normality

Influential Observation

Collinearity

Model Fit

등을 확인합니다.

올바른 Model Family를 선택했다고 해서 그 Model이 Data에 잘 맞는다는 것이 자동으로 보장되는 것은 아닙니다.

먼저 Plot을 보는 것이 중요한 이유

통계분석을 시작하자마자 p-value부터 계산하는 것보다 Data를 Visualization하는 것이 중요할 수 있습니다.

예를 들어:

Continuous Predictor + Continuous Response

Scatter Plot

Categorical Predictor + Continuous Response

Group별 Distribution / Box Plot

Categorical + Categorical

Frequency Table / Bar Chart

등으로 Pattern을 먼저 확인할 수 있습니다.

첨부 교재의 Regression Chapter도 Regression Model을 적용하기 전에 Scatter Plot과 Correlation을 통한 Exploratory Data Analysis를 먼저 배치합니다.

Statistical Software가 Model을 대신 선택해줄 수 있을까?

일부 Software 기능은 추천이나 자동 Model Selection을 제공할 수 있습니다.

하지만 Software가 다음 내용을 완벽하게 알 수는 없습니다.

  • 연구 목적
  • Clinical Meaning
  • Causal Structure
  • Data Collection Method
  • Variable Definition
  • Pre-specified Hypothesis

따라서 Software가 계산 가능한 Model을 보여준다는 것과 연구 질문에 적절한 Model이라는 것은 다릅니다.

흔한 오해 정리

“Continuous Variable이 있으면 Regression을 사용하면 된다”

아닙니다.

Response인지 Predictor인지와 다른 Variable의 Type을 함께 확인해야 합니다.

“Categorical Variable이 있으면 ANOVA를 사용한다”

항상 그렇지는 않습니다.

Categorical Variable이 Predictor이고 Response가 Continuous일 때 ANOVA 구조를 고려할 수 있습니다.

Categorical Variable이 Response라면 Logistic Regression 등 다른 Model이 필요할 수 있습니다.

“0과 1은 숫자이므로 Linear Regression을 사용한다”

아닙니다.

0/1이 Binary Category를 의미한다면 Categorical Response일 수 있습니다.

“Group이 두 개면 ANOVA는 사용할 수 없다”

그렇지 않습니다.

두 Group Mean 비교에서는 Two-Sample t-Test와 One-Way ANOVA가 연결될 수 있습니다.

“ANOVA와 Regression은 완전히 다른 분석이다”

둘 다 Continuous Response를 설명하는 Linear Model Framework 안에서 연결해서 이해할 수 있습니다.

“Logistic Regression은 Predictor도 Categorical이어야 한다”

아닙니다.

Categorical Response에 Continuous Predictor와 Categorical Predictor를 모두 사용할 수 있습니다.

“Statistical Model이 실행되면 적절한 Model을 선택한 것이다”

아닙니다.

Software가 계산했다는 것과 Statistical Validity는 별개의 문제입니다.

“Variable Type만 알면 Model 선택이 끝난다”

아닙니다.

Study Design, Distribution, Assumption, Sample Size 등도 확인해야 합니다.

SAS 분석에서 사용할 수 있는 기본 Model Selection 체크

분석 전에 다음 순서로 확인하면 좋습니다.

1. Research Question은 무엇인가?

무엇을 비교하거나 설명하려는가?

2. Response는 무엇인가?

분석의 Outcome을 명확히 합니다.

3. Response Type은 무엇인가?

Continuous인가 Categorical인가?

4. Predictor는 무엇인가?

Response를 설명할 Variable을 확인합니다.

5. Predictor Type은 무엇인가?

Categorical인가 Continuous인가?

6. Model 후보는 무엇인가?

ANOVA, Regression, Logistic Regression 등을 연결합니다.

7. Assumption은 적절한가?

Data와 Model 조건을 확인합니다.

8. Result를 어떻게 해석할 것인가?

Statistical Output을 Research Question으로 다시 연결합니다.

Statistical Model 선택의 전체 구조

첨부 교재에서 제시하는 기본 구조를 다시 정리하면 다음과 같습니다.

Type of Response

Continuous

Categorical Predictor

ANOVA

Continuous Predictor

OLS Regression

Categorical + Continuous Predictors

ANCOVA


Categorical

Categorical Predictor

Contingency Table Analysis / Logistic Regression

Continuous Predictor

Logistic Regression

Categorical + Continuous Predictors

Logistic Regression

Model Selection의 핵심은 분석 메뉴를 먼저 고르는 것이 아니라 Response와 Predictor의 Measurement Scale을 정확히 파악하는 것입니다.

왜 이 개념을 먼저 이해해야 할까?

앞으로 SAS에서 다음과 같은 분석을 각각 깊게 다루게 됩니다.

t-Test

두 Group Mean 비교

ANOVA

여러 Group Mean 비교

Correlation

두 Continuous Variable의 Association

Linear Regression

Continuous Response Modeling

Logistic Regression

Categorical Response Modeling

각 Procedure를 별개의 기술로 외우면 상황별 선택이 어렵습니다.

하지만:

Response Type

Predictor Type

Statistical Model

이라는 구조로 이해하면 모든 분석이 하나의 Framework로 연결됩니다.

핵심 정리

Statistical Model을 선택할 때 가장 먼저 확인해야 할 것은 Response Variable과 Predictor Variable의 유형입니다.

첨부 교재에서는 Statistical Modeling이 두 종류의 Variable Measurement Level에 따라 결정된다고 설명합니다.

Response는 분석의 주된 Outcome 또는 Target이고, Predictor는 Response와 관련되어 이를 설명하거나 예측하기 위해 사용하는 Variable입니다.

기본적인 Model 선택 구조는 다음과 같습니다.

Continuous Response

Categorical Predictor

ANOVA

Continuous Response

Continuous Predictor

OLS Regression

Continuous Response

Categorical + Continuous Predictors

ANCOVA

그리고:

Categorical Response

Contingency Table Analysis / Logistic Regression Framework

입니다.

하지만 이 구조는 출발점입니다.

실제 분석에서는 다음 단계로:

Measurement Scale

Model Candidate

Distribution 확인

Assumption 검토

Model 실행

Diagnostics

Interpretation

까지 이어져야 합니다.

올바른 Statistical Analysis는 ‘어떤 SAS 메뉴를 누를 것인가’에서 시작하는 것이 아니라 ‘내 Response와 Predictor는 어떤 종류의 Variable인가’를 정확히 정의하는 데서 시작합니다.

함께 읽으면 좋은 글

  • Measurement Scale의 중요성: 변수의 측정척도가 통계분석 방법을 결정하는 이유
  • Predictor와 Response Variable의 구조: 설명변수와 반응변수의 역할 이해
  • One-Way ANOVA의 구조: 하나의 범주형 변수가 연속형 결과에 미치는 영향 분석
  • Simple Linear Regression의 구조: 하나의 Predictor로 Response를 설명하는 원리
  • Multiple Linear Regression의 구조: 여러 Predictor의 효과를 동시에 추정하는 방식

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Fundamental Statistical Concepts
  • Overview of Statistical Models
  • Analysis of Variance
  • Exploratory Data Analysis and Regression
  • Categorical Data Analysis and Logistic Regression

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.