본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

Predictor와 Response Variable의 구조: 설명변수와 반응변수의 역할 이해

읽는 시간 약 54분

통계분석을 시작할 때 많은 사람이 먼저 어떤 Procedure를 사용할지 고민합니다.

ANOVA를 써야 할지, Regression을 해야 할지, Logistic Regression을 해야 할지부터 생각하는 경우가 많습니다.

하지만 Statistical Model을 선택하기 전에 먼저 해야 할 일이 있습니다.

바로 어떤 Variable이 Predictor이고 어떤 Variable이 Response인지 구분하는 것입니다.

Predictor Variable은 Response의 변화나 차이를 설명하기 위해 사용하는 변수이고, Response Variable은 분석을 통해 설명하거나 예측하고자 하는 결과 변수입니다.

같은 Dataset에 있는 Variable이라도 연구 질문에 따라 Predictor가 될 수도 있고 Response가 될 수도 있습니다.

따라서 Variable의 역할은 이름 자체보다 분석 목적과 Research Question에 의해 결정됩니다.

첨부 교재에서도 Statistical Model을 선택할 때 Response와 Predictor의 Measurement Scale을 함께 고려하며, 이 조합에 따라 ANOVA, Regression, Logistic Regression 등 서로 다른 Model을 연결합니다.

Predictor Variable이란 무엇인가?

Predictor Variable은 다른 Variable의 차이나 변화를 설명하는 데 사용하는 Variable입니다.

다른 용어로 다음과 같이 표현될 수 있습니다.

  • Predictor
  • Explanatory Variable
  • Independent Variable
  • Covariate
  • Factor

이 용어들이 모든 상황에서 완전히 동일한 의미는 아니지만, 기본적인 Statistical Model에서는 Response를 설명하기 위해 Model에 포함되는 Variable이라는 공통적인 역할을 가집니다.

예를 들어:

Age

가 높아질수록 Blood Pressure가 어떻게 변하는지를 분석한다고 가정해보겠습니다.

이 경우:

Predictor

Age

Response

Blood Pressure

입니다.

즉 Age라는 정보를 이용해 Blood Pressure의 변화 Pattern을 설명하려는 구조입니다.

Response Variable이란 무엇인가?

Response Variable은 Statistical Analysis에서 설명하거나 비교하거나 예측하고 싶은 결과입니다.

다음과 같은 용어로도 표현될 수 있습니다.

  • Response Variable
  • Outcome Variable
  • Dependent Variable
  • Target Variable

예를 들어:

“Treatment에 따라 Outcome Score가 다른가?”

라는 질문이 있다고 가정해보겠습니다.

이 경우:

Predictor

Treatment

Response

Outcome Score

입니다.

분석의 관심이 Outcome Score에 있기 때문입니다.

Response는 단순히 Dataset의 마지막 Column이 아니라 연구 질문에서 결과로 보고 싶은 Variable입니다.

Predictor와 Response는 어떻게 구분할까?

가장 쉬운 방법은 Research Question을 문장으로 바꾸는 것입니다.

예를 들어:

“Treatment Group에 따라 Blood Pressure가 달라지는가?”

라는 질문이 있습니다.

여기서:

무엇에 따라?

Treatment Group

Predictor

그리고:

무엇이 달라지는가?

Blood Pressure

Response

입니다.

이 구조를 기억하면 Variable Role을 비교적 쉽게 구분할 수 있습니다.

같은 Variable도 Predictor와 Response가 바뀔 수 있을까?

가능합니다.

예를 들어 Age라는 Variable을 생각해보겠습니다.

연구 질문 A:

“Age가 증가할수록 Cognitive Score가 감소하는가?”

이 경우:

Age = Predictor

Cognitive Score = Response

입니다.

하지만 연구 질문 B:

“Disease Group에 따라 Diagnosis Age가 다른가?”

라면:

Disease Group = Predictor

Age = Response

가 될 수 있습니다.

따라서 Variable 자체에 Predictor 또는 Response라는 고정된 속성이 있는 것은 아닙니다.

Predictor와 Response의 역할은 Data Dictionary보다 Research Question에서 먼저 결정됩니다.

Predictor와 Response를 거꾸로 넣으면 어떻게 될까?

매우 중요한 문제입니다.

예를 들어 다음 관계를 분석한다고 가정해보겠습니다.

Height

Weight를 설명

Model을:

Weight = Height

형태로 구성할 수 있습니다.

그런데 실수로:

Height = Weight

로 바꾸면 같은 두 Variable을 사용하더라도 분석 질문이 달라집니다.

첫 번째 Model은:

“Height 변화에 따라 Weight가 어떻게 달라지는가?”

이고,

두 번째 Model은:

“Weight 변화에 따라 Height가 어떻게 달라지는가?”

입니다.

Correlation에서는 두 Variable의 순서를 바꾸어도 Correlation Coefficient 자체는 동일할 수 있지만 Regression에서는 Response와 Predictor를 바꾸면 Model의 의미가 달라집니다.

Response가 왜 Statistical Model 선택에 중요한가?

첨부 교재의 Statistical Model Overview에서는 Response Variable의 Type이 Model 선택에 매우 중요한 기준으로 제시됩니다.

예를 들어 Response가 Continuous라면:

  • ANOVA
  • OLS Regression
  • ANCOVA

같은 Model을 고려할 수 있습니다.

반면 Response가 Categorical이라면:

  • Categorical Data Analysis
  • Logistic Regression

등을 고려할 수 있습니다.

즉 첫 번째 질문은 다음과 같습니다.

“내가 설명하려는 Response는 어떤 형태의 Variable인가?”

이 질문에 답한 뒤 Predictor 구조를 확인해야 합니다.

Continuous Response란 무엇인가?

Response가 연속형 Numeric Variable인 경우입니다.

예를 들어:

  • Blood Pressure
  • Weight
  • Test Score
  • Cholesterol
  • Income
  • Reaction Time

등이 있습니다.

예를 들어:

Treatment

Blood Pressure

를 분석한다고 가정해보겠습니다.

Blood Pressure가 Continuous Response라면 Predictor Type에 따라 분석 방법이 달라질 수 있습니다.

Categorical Response란 무엇인가?

Response가 Category 형태인 경우입니다.

예를 들어:

  • Success / Failure
  • Yes / No
  • Survived / Died
  • Disease / No Disease
  • Responder / Non-Responder

등이 있을 수 있습니다.

예를 들어:

Age + Treatment

Treatment Success

를 분석한다고 가정해보겠습니다.

Response가:

0 = Failure

1 = Success

라면 Binary Categorical Response입니다.

이 경우 일반적인 Linear Regression보다는 Logistic Regression 같은 Model을 고려할 수 있습니다.

Predictor가 Categorical이면 어떤 분석 구조가 될까?

첨부 교재에서는 Continuous Response와 Categorical Predictor의 조합에 ANOVA를 연결합니다.

예를 들어:

Treatment Group

Placebo / Drug A / Drug B

Categorical Predictor

그리고

Outcome Score

Continuous Response

라면:

Group Mean Comparison

이라는 분석 질문이 만들어집니다.

즉 각 Treatment Group에서 Outcome Score 평균이 다른지를 분석하는 구조입니다.

Predictor가 Continuous이면 무엇이 달라질까?

Continuous Predictor는 Category가 아니라 연속적인 값을 가집니다.

예:

  • Age
  • Height
  • Weight
  • Baseline Score
  • Dose
  • Temperature

예를 들어:

Age

Continuous Predictor

Blood Pressure

Continuous Response

라면:

Age가 1단위 증가할 때 Blood Pressure가 평균적으로 얼마나 변하는가?

라는 Regression 형태의 질문을 만들 수 있습니다.

첨부 교재에서도 Continuous Predictor와 Continuous Response의 조합에 Ordinary Least Squares Regression을 연결합니다.

Categorical Predictor와 Continuous Predictor를 함께 사용할 수 있을까?

가능합니다.

실제 Statistical Model에서는 Predictor가 하나만 있는 경우보다 여러 종류의 Predictor를 동시에 사용하는 경우가 많습니다.

예를 들어:

Treatment

Categorical

Age

Continuous

Baseline Score

Continuous

Outcome

Continuous

같은 구조입니다.

첨부 교재에서는 Continuous Response에 Categorical Predictor와 Continuous Predictor가 함께 있는 경우 ANCOVA 구조를 제시합니다.

Predictor를 여러 개 사용하면 무엇을 알 수 있을까?

예를 들어 다음 Model을 생각해보겠습니다.

Outcome

=

Treatment

Age

Baseline Score

이 경우 각 Predictor가 Response와 어떤 관계를 갖는지 다른 Predictor를 함께 고려하면서 추정할 수 있습니다.

예를 들어 Treatment Effect를 분석하면서 Age와 Baseline Score 차이를 함께 고려할 수 있습니다.

이것이 Multiple Regression이나 ANCOVA 같은 Model이 필요한 이유 중 하나입니다.

하나의 Predictor만 사용하는 분석은 어떤 구조일까?

Simple Model에서는 Predictor가 하나만 있습니다.

예를 들어:

Weight

=

Height

형태입니다.

이 경우 질문은 단순합니다.

Height가 증가할수록 Weight가 어떻게 변하는가?

이를 Simple Linear Regression 구조로 생각할 수 있습니다.

전체 관계는:

Predictor X

Response Y

형태입니다.

Predictor가 많으면 Model이 무조건 좋아질까?

그렇지 않습니다.

Predictor를 추가하면 더 많은 정보를 Model에 넣을 수 있지만 다음과 같은 문제가 생길 수 있습니다.

  • Overfitting
  • Multicollinearity
  • 불필요한 Variable 포함
  • Interpretation 복잡성
  • Sample Size 대비 Parameter 증가

따라서 Predictor는 많을수록 좋은 것이 아니라 Research Question과 Model 목적에 맞게 선택해야 합니다.

Predictor와 원인을 같은 의미로 봐도 될까?

아닙니다.

이 부분은 매우 중요합니다.

Predictor Variable이 Response와 Statistical Association을 보인다고 해서 그 Predictor가 Response의 원인이라는 뜻은 아닙니다.

예를 들어:

Ice Cream Sales

Drowning Incidents

가 함께 증가한다고 가정해보겠습니다.

한 Variable이 다른 Variable의 직접적인 원인이라기보다 Temperature 같은 제3의 Variable이 둘 모두와 관련되어 있을 수 있습니다.

따라서:

Predictor

Cause

입니다.

Predictor라는 용어는 Model에서 Response를 설명하는 역할을 의미하며 인과관계를 자동으로 보장하지 않습니다.

Independent Variable이라고 부르면 정말 독립적인가?

통계 교재에서는 Predictor를 Independent Variable이라고 표현하는 경우도 많습니다.

하지만 이 용어 때문에 Variable끼리 Statistical Independence가 반드시 존재한다고 오해하면 안 됩니다.

예를 들어 Multiple Regression에서:

Age

Weight

BMI

가 Predictor로 함께 들어간다고 가정해보겠습니다.

이들은 서로 상당한 Correlation을 가질 수 있습니다.

따라서 Independent Variable이라는 표현은 주로 Response와의 역할 구분에 사용되는 전통적인 용어이지, Predictor끼리 실제로 독립이라는 보장은 아닙니다.

Factor는 Predictor와 어떻게 다를까?

ANOVA에서는 Categorical Predictor를 Factor라고 부르는 경우가 많습니다.

예를 들어:

Fertilizer

A / B / C

가 있고

Bulb Weight

를 비교한다고 가정해보겠습니다.

이 경우:

Fertilizer = Factor

Bulb Weight = Response

입니다.

첨부 교재의 One-Way ANOVA 실습에서도 Garlic의 Fertilizer Type에 따라 Bulb Weight 평균이 다른지를 분석합니다.

즉 Factor는 Categorical Predictor의 역할을 강조한 표현이라고 이해할 수 있습니다.

Level이란 무엇인가?

Categorical Predictor에는 여러 Category가 있을 수 있습니다.

이 각각의 Category를 Level이라고 부를 수 있습니다.

예를 들어:

Treatment Factor

Placebo

Low Dose

High Dose

라면 Treatment라는 Factor에는 3개의 Level이 있습니다.

ANOVA에서는 이러한 Level 사이에서 Response Mean을 비교합니다.

즉:

Factor

Treatment

Levels

Placebo / Low Dose / High Dose

Response

Outcome

입니다.

Covariate란 무엇인가?

Covariate는 Statistical Model에 포함되는 Predictor 중 하나를 지칭할 때 사용하는 용어입니다.

특히 Continuous Predictor를 Covariate라고 부르는 경우가 많습니다.

예를 들어:

Treatment

Factor

Baseline Score

Covariate

Outcome

Response

같은 구조입니다.

Baseline Score는 Treatment Group 비교에서 Outcome에 영향을 줄 가능성이 있는 Continuous Variable로 Model에 포함될 수 있습니다.

Confounder와 Predictor는 같은 것일까?

같은 개념은 아닙니다.

Confounder는 Exposure와 Outcome 사이의 관계를 왜곡할 수 있는 Variable을 의미합니다.

Confounder를 Statistical Model의 Predictor로 포함할 수 있지만 모든 Predictor가 Confounder인 것은 아닙니다.

예를 들어:

Treatment

Age

Sex

Baseline Disease Severity

를 모두 Predictor로 사용할 수 있지만 이들 각각의 역할은 연구 설계와 분석 목적에 따라 다를 수 있습니다.

따라서 Statistical Role을 정확하게 구분해야 합니다.

Response는 하나만 있어야 할까?

기본적인 Regression이나 ANOVA에서는 하나의 Response를 중심으로 Model을 설명하는 경우가 많습니다.

하지만 실제 연구에서는 여러 Outcome이 존재할 수 있습니다.

예를 들어 Clinical Study에서는:

  • Cognitive Score
  • Functional Score
  • Biomarker
  • Quality of Life

등 여러 Response를 분석할 수 있습니다.

이 경우 각 Response마다 별도의 Statistical Model을 구성할 수 있습니다.

즉 Dataset에 여러 Outcome이 있다고 해서 하나의 Model에서 모두 동일한 Response 역할을 하는 것은 아닙니다.

Primary Response와 Secondary Response는 무엇이 다를까?

연구에서는 Outcome의 중요도에 따라 Primary와 Secondary로 구분할 수 있습니다.

예:

Primary Outcome

Cognitive Score Change

Secondary Outcome

Functional Score Change

각 Outcome은 Statistical Analysis에서 Response가 될 수 있습니다.

하지만 연구 목적과 Hypothesis Structure에서 중요도가 다릅니다.

따라서 Statistical Variable Role과 Study Endpoint Role은 연결되어 있지만 완전히 같은 개념으로 단순화해서는 안 됩니다.

Baseline과 Change from Baseline은 다른 Response일까?

가능합니다.

예를 들어 Baseline Score가:

70

Week 12 Score가:

60

이라면 Change from Baseline을:

60 – 70 = -10

으로 정의할 수 있습니다.

이때 분석에서는:

Baseline Score

Predictor / Covariate

Change from Baseline

Response

처럼 사용할 수 있습니다.

즉 같은 측정 개념에서 파생된 Variable이라도 Model에서 서로 다른 역할을 가질 수 있습니다.

Derived Variable도 Response가 될 수 있을까?

가능합니다.

Response는 반드시 Raw Data에 직접 존재해야 하는 것은 아닙니다.

예를 들어 다음과 같은 Derived Outcome을 만들 수 있습니다.

  • Change from Baseline
  • Percentage Change
  • Responder Status
  • Time to Event
  • Composite Score

이러한 Derived Variable도 Statistical Question에 따라 Response가 될 수 있습니다.

하지만 Derivation Rule이 정확해야 합니다.

Response의 품질은 Statistical Model뿐 아니라 Response가 어떻게 정의되고 생성되었는지에도 좌우됩니다.

Binary Response는 어떻게 만들어질까?

Continuous Outcome을 특정 기준으로 Binary Category로 바꾸는 경우가 있습니다.

예를 들어 Score Change가:

≤ -10

이면 Responder

그 외에는 Non-Responder

로 정의한다고 가정해보겠습니다.

원래 Variable은 Continuous였지만 Derived Response는:

0 = Non-Responder

1 = Responder

라는 Binary Variable이 됩니다.

이렇게 Response Scale이 바뀌면 Statistical Method도 달라질 수 있습니다.

Continuous Response를 Category로 바꾸면 정보가 줄어들 수 있다

예를 들어 Blood Pressure를 그대로 Continuous Response로 사용하면 실제 측정값의 모든 차이를 활용할 수 있습니다.

하지만:

Normal

High

두 Category로 나누면 세부적인 Numerical Information이 사라집니다.

120과 139가 같은 Category가 될 수 있고,

140과 180도 같은 Category가 될 수 있습니다.

따라서 Response를 Category화하면 Model이 단순해질 수 있지만 정보 손실도 고려해야 합니다.

Predictor를 Category로 변환할 수도 있을까?

가능합니다.

예를 들어 Age를:

<65

65–74

≥75

로 나누면 Continuous Predictor에서 Categorical Predictor로 바뀝니다.

그러면 Statistical Model에서 Age의 역할도 달라질 수 있습니다.

Continuous Age를 사용할 때는:

Age 1년 증가에 따른 변화

를 Modeling할 수 있습니다.

Categorical Age를 사용할 때는:

Age Group 간 차이

를 비교하게 됩니다.

즉 Coding 방식이 Research Question의 형태까지 바꿀 수 있습니다.

Continuous Predictor를 그대로 사용하는 장점

Age를 Continuous로 사용하면 모든 Age Information을 유지할 수 있습니다.

예를 들어:

61

62

63

64

라는 차이를 모두 활용합니다.

Regression에서는:

Age가 1년 증가할 때 Response가 평균적으로 얼마나 변하는가?

라는 형태의 Parameter를 추정할 수 있습니다.

하지만 여기에는 Age와 Response의 Relationship을 어떻게 Modeling하는지에 대한 Assumption이 들어갈 수 있습니다.

Continuous Predictor라고 반드시 Linear Relationship일까?

아닙니다.

Age가 Continuous라고 해서 Response가 Age에 대해 직선적으로 변한다고 자동으로 가정할 수는 없습니다.

예를 들어:

Age

Risk

관계가 어느 시점부터 급격하게 증가할 수도 있습니다.

따라서 Regression에서는 Scatter Plot이나 Diagnostic을 통해 Relationship 형태를 확인해야 합니다.

Measurement Scale은 Predictor가 어떤 값인지 설명하지만 Predictor와 Response의 실제 Relationship 형태까지 결정하지는 않습니다.

Interaction이 생기면 Predictor 해석이 어떻게 달라질까?

두 Predictor가 Response에 서로 독립적으로 영향을 주는 것이 아니라 한 Predictor의 효과가 다른 Predictor Level에 따라 달라질 수 있습니다.

예를 들어:

Treatment

Gender

사이에 Interaction이 있다고 가정해보겠습니다.

Treatment Effect가 Male과 Female에서 다르게 나타날 수 있습니다.

즉:

Treatment Effect

Gender에 따라 달라짐

이 경우 Predictor 하나의 Coefficient만 단독으로 해석하면 충분하지 않을 수 있습니다.

이후 Two-Way ANOVA와 Regression에서 Interaction을 별도로 다룰 예정입니다.

Predictor와 Response의 Direction을 먼저 정해야 하는 이유

Data Analysis 전에 다음 질문에 답하는 것이 좋습니다.

무엇을 설명하고 싶은가?

이것이 Response입니다.

그리고:

무엇을 이용해서 설명할 것인가?

이것이 Predictor입니다.

예를 들어:

“Baseline Score를 이용해 Follow-up Score를 예측하고 싶다.”

라면:

Baseline Score = Predictor

Follow-up Score = Response

입니다.

이렇게 Direction을 먼저 정하면 Statistical Model의 구조가 명확해집니다.

Prediction과 Explanation은 같은 목적일까?

항상 같지는 않습니다.

Regression Model을 사용하는 목적에는 크게 다음과 같은 관점이 있을 수 있습니다.

Explanation

어떤 Predictor가 Response와 어떤 관계를 갖는지 이해

Prediction

새로운 Observation의 Response를 정확하게 예측

두 목적은 Model 선택이나 Predictor Selection에서 다른 우선순위를 가질 수 있습니다.

예를 들어 Prediction Model에서는 해석이 복잡하더라도 Predictive Performance가 중요한 경우가 있습니다.

반면 Scientific Explanation에서는 각 Predictor의 의미와 Confounding Control이 중요할 수 있습니다.

Predictor의 Statistical Significance만 보면 될까?

아닙니다.

Model에서 Predictor의 p-value가 유의한지 확인할 수 있지만 다음 요소도 함께 고려해야 합니다.

  • Effect Size
  • Confidence Interval
  • Clinical / Practical Meaning
  • Model Assumption
  • Confounding
  • Multicollinearity
  • Sample Size

즉:

p < 0.05

라고 해서 해당 Predictor가 반드시 중요한 원인이라는 뜻은 아닙니다.

이후 Statistical Significance와 Practical Significance를 별도로 다룰 예정입니다.

Response의 Distribution도 중요할까?

매우 중요합니다.

Response의 Type과 Distribution은 Statistical Model 선택에 큰 영향을 줍니다.

예를 들어:

Continuous Response

Normal에 가까운 구조

Linear Model을 고려할 수 있음

Binary Response

0 / 1

Logistic Regression 고려

Count Response

0, 1, 2, 3…

다른 Count Model이 필요할 수 있음

따라서 Response를 단순히 Numeric 또는 Character로만 보는 것은 부족합니다.

Predictor에도 Distribution을 확인해야 할까?

필요할 수 있습니다.

특히 Continuous Predictor에서는:

  • Extreme Value
  • Skewness
  • Restricted Range
  • Missing
  • Nonlinear Pattern

등을 확인하는 것이 도움이 됩니다.

Categorical Predictor에서는:

  • Category Frequency
  • Rare Category
  • Empty Level
  • Coding Error

등을 확인할 수 있습니다.

즉 Predictor도 Model에 들어가기 전에 Data Quality와 Distribution을 점검해야 합니다.

Rare Category가 Predictor에 있으면 어떤 문제가 생길까?

예를 들어 Treatment Group이:

Placebo = 500명

Drug A = 495명

Drug B = 5명

이라고 가정해보겠습니다.

Drug B의 Observation이 매우 적으면 해당 Group Effect를 안정적으로 추정하기 어려울 수 있습니다.

Statistical Software가 Model을 실행하더라도 Estimate가 불안정하거나 Confidence Interval이 넓을 수 있습니다.

따라서 Categorical Predictor에서는 단순 Level 존재 여부보다 각 Level의 Sample Size를 확인해야 합니다.

Missing Predictor가 있으면 Observation이 제외될 수 있을까?

Model에 필요한 Predictor 또는 Response가 Missing이면 해당 Observation이 분석에서 제외되는 경우가 있을 수 있습니다.

예를 들어 1,000명의 Dataset에서:

Outcome은 모두 존재하지만

Age가 100명에서 Missing이라고 가정해보겠습니다.

Age를 Predictor로 Model에 포함하면 실제 분석 N이 줄어들 수 있습니다.

따라서 다음을 확인해야 합니다.

Total N

Model Used N

두 값이 왜 다른지 이해해야 합니다.

Response가 Missing이면 더 중요한 이유

Response가 Missing이면 해당 Observation에서 분석하려는 Outcome 자체가 없기 때문에 Model에 포함되지 못할 수 있습니다.

따라서 Statistical Analysis 전에:

  • Response Missing Rate
  • Predictor Missing Rate
  • Missing Pattern

등을 확인하는 것이 중요합니다.

단순히 SAS가 몇 명을 분석했는지 보는 것보다 왜 그 N이 사용되었는지를 이해해야 합니다.

Identifier를 Predictor로 넣으면 안 되는 이유

Dataset에는 다음과 같은 ID가 있을 수 있습니다.

SubjectID

SiteID

TransactionID

이 값들은 Observation을 구분하기 위한 Identifier일 수 있습니다.

예를 들어 SubjectID가:

1001

1002

1003

처럼 숫자로 저장되어 있어도 일반적인 상황에서 Response를 설명하는 Quantitative Predictor로 사용하면 안 됩니다.

ID Number 자체에는 Measurement Meaning이 없기 때문입니다.

숫자로 저장된 Variable이라고 모두 Predictor 후보가 되는 것은 아닙니다.

Site를 Predictor로 사용할 수는 있을까?

흥미로운 차이입니다.

Subject ID처럼 각 Observation을 고유하게 구분하는 Identifier와 Site처럼 Group을 나타내는 Variable은 다릅니다.

Site는 연구 목적에 따라 Categorical Predictor 또는 Stratification Factor로 활용할 수 있습니다.

예를 들어 Site별 Outcome 차이를 고려할 수 있습니다.

따라서 Identifier처럼 보이는 Variable이라도 실제 의미와 분석 목적을 확인해야 합니다.

Time은 Predictor일까 Response일까?

둘 다 가능할 수 있습니다.

예를 들어 Longitudinal Data에서:

Week

를 Predictor로 사용하여 시간이 지나면서 Score가 어떻게 변하는지 분석할 수 있습니다.

반면 Survival Analysis에서는 Time to Event 자체가 Response의 일부가 될 수 있습니다.

즉 Variable의 역할은 이름만으로 결정할 수 없습니다.

Baseline Score를 Predictor로 넣는 이유

Clinical 또는 Experimental Data에서는 Baseline Score가 중요한 Covariate가 될 수 있습니다.

예를 들어 Treatment 후 Outcome을 분석할 때 시작점의 차이를 고려하기 위해 Baseline을 Model에 포함할 수 있습니다.

구조는:

Treatment

Categorical Predictor

Baseline

Continuous Predictor

Outcome

Continuous Response

입니다.

첨부 교재에서 설명하는 ANCOVA 구조와 연결해서 이해할 수 있습니다.

Treatment는 항상 Predictor일까?

Randomized Trial 같은 맥락에서는 Treatment Group을 Predictor 또는 Factor로 사용하는 경우가 많습니다.

하지만 모든 Dataset에서 Treatment라는 이름의 Variable이 항상 Predictor라고 단정할 수는 없습니다.

예를 들어 연구 질문 자체가:

“어떤 환자 특성이 특정 Treatment 선택과 관련되는가?”

라면 Treatment Choice가 Response가 될 수도 있습니다.

다시 말해:

Variable Name

이 아니라

Research Question

이 역할을 결정합니다.

Outcome이라는 이름이면 항상 Response일까?

대부분 그렇게 사용될 수 있지만 이름만 믿는 것은 위험할 수 있습니다.

예를 들어 Dataset에:

Outcome_Baseline

Outcome_Week12

Outcome_Change

가 있을 수 있습니다.

연구 질문에 따라:

Outcome_Change를 Response

Outcome_Baseline을 Predictor

로 사용할 수 있습니다.

따라서 Variable Label과 Analysis Plan을 함께 확인해야 합니다.

Data Dictionary와 Analysis Plan이 중요한 이유

Variable Role을 정확하게 결정하려면 Dataset만 보는 것보다 다음 정보를 함께 보는 것이 좋습니다.

  • Research Question
  • Variable Definition
  • Endpoint Definition
  • Coding
  • Measurement Scale
  • Analysis Plan

예를 들어 RESP라는 Variable이 있어도 이것이:

Response Score

인지

Responder Status

인지 확인해야 합니다.

둘은 Statistical Scale부터 다를 수 있습니다.

Predictor와 Response를 정한 뒤 무엇을 확인해야 할까?

다음 순서로 진행하면 좋습니다.

Research Question

Response 결정

Measurement Scale 확인

Predictor 결정

Measurement Scale 확인

Study Design 확인

Statistical Model 선택

이 구조가 Model Selection의 기본입니다.

Predictor와 Response 조합별 Statistical Model

첨부 교재에서 제시하는 구조를 단순화하면 다음과 같습니다.

Continuous Response + Categorical Predictor

ANOVA

Continuous Response + Continuous Predictor

Ordinary Least Squares Regression

Continuous Response + Categorical + Continuous Predictors

ANCOVA

Categorical Response

Categorical Data Analysis / Logistic Regression

이는 Statistical Model을 단순히 메뉴 이름으로 외우지 않고 Variable Role과 Measurement Scale의 조합으로 이해할 수 있게 해줍니다.

ANOVA의 Predictor와 Response

예를 들어 Fertilizer에 따라 Garlic Bulb Weight가 다른지를 분석한다고 가정해보겠습니다.

첨부 교재의 ANOVA Example에서도 Fertilizer 종류별 평균 Bulb Weight 차이를 분석합니다.

구조는:

Predictor / Factor

Fertilizer

Categorical

Response

Bulb Weight

Continuous

ANOVA

입니다.

Linear Regression의 Predictor와 Response

이번에는:

Advertising Cost가 증가할수록 Sales가 어떻게 변하는가?

를 분석한다고 가정해보겠습니다.

Predictor

Advertising Cost

Continuous

Response

Sales

Continuous

Linear Regression

형태입니다.

이때 Regression Coefficient는 Predictor 1단위 증가와 Response 평균 변화량 사이의 관계를 나타낼 수 있습니다.

Logistic Regression의 Predictor와 Response

이번에는 Patient Survival을 분석한다고 가정해보겠습니다.

Response

Survived / Died

Binary Categorical

그리고 Predictor가:

  • Age
  • Gender
  • Class

라면:

Predictors

Continuous + Categorical

Binary Response

Logistic Regression

형태가 됩니다.

첨부 교재의 Logistic Regression 예제에서도 Survival을 Response로 하고 Age, Gender, Class 및 Interaction 등을 Model에 포함합니다.

Response를 Coding할 때 방향이 중요한 이유

Binary Response가:

0 = Died

1 = Survived

라고 되어 있다고 가정해보겠습니다.

Logistic Regression에서는 어떤 Event를 Modeling하는지에 따라 Coefficient와 Odds Ratio의 해석 방향이 달라질 수 있습니다.

즉:

Event = Survived

Event = Died

는 반대 방향의 질문입니다.

따라서 Response의 Coding과 Event Definition을 반드시 확인해야 합니다.

Predictor Reference Category도 확인해야 한다

Categorical Predictor에서는 어느 Category가 Reference인지에 따라 Parameter Interpretation이 달라질 수 있습니다.

예를 들어:

Gender

Female / Male

에서 Female을 Reference로 선택하면 Male Effect는 Female과 비교해 해석할 수 있습니다.

반대로 Male을 Reference로 바꾸면 Coefficient의 방향도 달라질 수 있습니다.

하지만 실제 Data Relationship이 바뀐 것은 아닙니다.

Reference Category는 Predictor의 비교 기준을 바꾸는 것이지 Variable 자체의 Measurement Scale을 바꾸는 것은 아닙니다.

Response와 Predictor에 단위를 기록해야 하는 이유

Continuous Variable에서는 Unit이 Coefficient Interpretation에 직접 영향을 줍니다.

예를 들어 Age가 Year 단위라면:

Regression Coefficient = 0.5

는 Age 1년 증가에 따른 Response 변화량으로 해석할 수 있습니다.

Age를 10년 단위로 재표현하면 Coefficient도 달라집니다.

따라서:

  • Variable
  • Unit
  • Scale

을 함께 확인해야 합니다.

Predictor의 단위를 바꾸면 Model 자체가 달라질까?

예를 들어 Weight를 kg에서 g으로 변환한다고 가정해보겠습니다.

실제 Physical Relationship은 동일합니다.

하지만 Regression Coefficient의 숫자는 Unit에 따라 달라질 수 있습니다.

즉:

kg당 변화량

g당 변화량

의 숫자가 다릅니다.

따라서 Coefficient 크기만 비교하기 전에 Predictor Unit을 확인해야 합니다.

Standardized Predictor를 사용하는 이유

서로 다른 Unit을 가진 Predictor를 비교하기 위해 Standardization을 사용하는 경우가 있습니다.

예를 들어:

Age = years

Income = dollars

Weight = kg

를 그대로 비교하면 Coefficient 크기만으로 어느 Predictor가 더 영향이 큰지 단순 비교하기 어렵습니다.

Standardization을 적용하면 Scale을 맞추는 접근을 사용할 수 있습니다.

하지만 Standardized Coefficient도 Causal Importance를 자동으로 의미하는 것은 아닙니다.

Predictor끼리 관계가 너무 강하면 어떻게 될까?

Multiple Regression에서 Predictor끼리 높은 Correlation을 보이면 Multicollinearity 문제가 발생할 수 있습니다.

예:

Weight

BMI

Waist Circumference

가 동시에 Predictor로 들어갈 때 서로 강하게 관련될 수 있습니다.

이 경우 각 Predictor의 독립적인 Coefficient를 안정적으로 추정하기 어려워질 수 있습니다.

이 문제는 50번 글에서 별도로 다룰 예정입니다.

Response의 Outlier는 Model에 영향을 줄까?

가능합니다.

예를 들어 Continuous Response에서 극단적으로 큰 값이 하나 존재하면 Regression Line이나 Group Mean에 영향을 줄 수 있습니다.

따라서 Model을 실행하기 전에 Response Distribution을 확인하는 것이 중요합니다.

첨부 교재에서도 본격적인 Inferential Analysis 전에 unusual value, spread, shape, extreme value 등을 확인하는 접근을 강조합니다.

Predictor의 Outlier도 중요하다

Continuous Predictor에 극단적인 값이 존재하면 Regression Model에 큰 영향을 줄 수 있습니다.

특히 Predictor 공간에서 다른 Observation과 멀리 떨어진 값은 High Leverage Observation이 될 수 있습니다.

따라서:

Response Outlier

Predictor Extreme Value

를 모두 확인해야 합니다.

이후 Regression Diagnostics에서 더 자세히 살펴볼 수 있습니다.

Predictor를 선택할 때 p-value만 사용하면 안 되는 이유

Model Building 과정에서 Predictor Selection Method를 사용할 수도 있습니다.

하지만 Statistical Significance만을 기준으로 Predictor를 포함하거나 제외하면 연구 목적과 중요한 Confounder를 놓칠 수 있습니다.

Predictor 선택에는 다음을 함께 고려해야 합니다.

  • Subject-Matter Knowledge
  • Study Design
  • Pre-specified Analysis
  • Statistical Evidence
  • Multicollinearity
  • Model Purpose

즉 Automatic Selection은 보조적인 도구로 이해해야 합니다.

Research Question에서 Predictor와 Response를 찾는 방법

문장을 다음 구조로 만들어보면 쉽습니다.

X가 Y에 영향을 주거나 관련되어 있는가?

여기서:

X = Predictor

Y = Response

예:

“Treatment가 Outcome Score에 영향을 주는가?”

Treatment = Predictor

Outcome Score = Response

또는:

“Age와 Baseline Score로 Treatment Success를 예측할 수 있는가?”

Age / Baseline Score = Predictors

Treatment Success = Response

입니다.

Predictor와 Response를 정하기 전 분석하면 어떤 문제가 생길까?

Procedure를 먼저 선택하면 Research Question에 분석을 맞추는 것이 아니라 분석 방법에 질문을 억지로 맞추게 될 수 있습니다.

예를 들어:

“Regression을 해야겠다.”

라고 먼저 결정하고 Variable을 끼워 넣는 것보다:

무엇을 알고 싶은가?

Response 결정

어떤 정보로 설명할 것인가?

Predictor 결정

Scale 확인

Statistical Method 선택

순서가 더 논리적입니다.

Predictor와 Response의 전체 구조

지금까지 내용을 정리하면 다음과 같습니다.

Research Question

Response

무엇을 설명하거나 예측할 것인가?

Measurement Scale 확인

Predictor

무엇을 이용해서 설명할 것인가?

Measurement Scale 확인

Statistical Model

예:

Continuous Response

Categorical Predictor

ANOVA

또는

Continuous Response

Continuous Predictor

Regression

또는

Categorical Response

Logistic Regression

Statistical Model은 Procedure 이름에서 시작하는 것이 아니라 Response와 Predictor의 역할을 정의하는 것에서 시작합니다.

흔한 오해 정리

“Independent Variable은 다른 Variable과 독립적이다”

반드시 그렇지는 않습니다.

Predictor끼리 Correlation이 존재할 수 있습니다.

“Predictor는 Response의 원인이다”

아닙니다.

Predictor와 Response의 Association만으로 Causality가 보장되지는 않습니다.

“Dataset에서 왼쪽 Column이 Predictor이고 오른쪽 Column이 Response다”

아닙니다.

Variable 역할은 Research Question으로 결정됩니다.

“같은 Variable은 항상 Predictor 또는 항상 Response다”

그렇지 않습니다.

연구 질문에 따라 역할이 바뀔 수 있습니다.

“Response가 Numeric이면 항상 Linear Regression을 사용한다”

아닙니다.

Measurement Scale, Predictor Type, Distribution, Study Design 등을 함께 확인해야 합니다.

“0과 1로 Coding된 Response는 Continuous다”

반드시 그렇지 않습니다.

Success/Failure처럼 Binary Categorical Response일 수 있습니다.

“Predictor를 많이 넣을수록 Model이 좋아진다”

아닙니다.

Overfitting과 Multicollinearity 등을 고려해야 합니다.

“Reference Category가 바뀌면 실제 Relationship도 바뀐다”

아닙니다.

Parameter의 표현과 해석 기준이 달라질 수 있지만 Data의 실제 관계 자체가 바뀌는 것은 아닙니다.

Predictor와 Response를 어떻게 기억하면 쉬울까?

다음 두 질문으로 기억하면 됩니다.

Response

“무엇을 알고 싶은가?”

Predictor

“무엇을 이용해서 그것을 설명할 것인가?”

예를 들어:

“Age가 Blood Pressure와 관련이 있는가?”

라면:

Age

Predictor

Blood Pressure

Response

입니다.

그리고 다음 단계에서 두 Variable의 Measurement Scale을 확인합니다.

왜 이 개념을 먼저 이해해야 할까?

앞으로 SAS에서 다음과 같은 Statistical Model을 배우게 됩니다.

ANOVA

Categorical Predictor + Continuous Response

Linear Regression

Continuous Predictor + Continuous Response

Multiple Regression

Multiple Predictors + Continuous Response

Logistic Regression

Predictor(s) + Categorical Response

따라서 각 Procedure를 별도로 외우는 것보다 Response와 Predictor의 구조를 먼저 이해하면 Model Selection이 훨씬 체계적으로 보입니다.

핵심 정리

Predictor Variable은 Statistical Model에서 Response의 변화나 차이를 설명하기 위해 사용하는 Variable이고, Response Variable은 분석을 통해 설명하거나 예측하고자 하는 결과입니다.

가장 중요한 점은 Variable 역할이 고정되어 있지 않다는 것입니다.

같은 Age Variable이라도 어떤 연구에서는 Predictor가 될 수 있고 다른 연구에서는 Response가 될 수 있습니다.

전체 분석 흐름은 다음과 같습니다.

Research Question

Response 결정

Response Measurement Scale 확인

Predictor 결정

Predictor Measurement Scale 확인

Statistical Model 선택

첨부 교재에서도 Predictor와 Response의 Type 조합에 따라 ANOVA, Ordinary Least Squares Regression, ANCOVA, Logistic Regression 같은 Model을 구분합니다.

예를 들어:

Categorical Predictor

Continuous Response

ANOVA

그리고:

Continuous Predictor

Continuous Response

Regression

반면:

Categorical Response

Logistic Regression 등을 고려할 수 있습니다.

Predictor와 Response를 올바르게 구분하는 것은 Statistical Model을 실행하기 전에 연구 질문을 분석 가능한 구조로 바꾸는 핵심 과정입니다.

함께 읽으면 좋은 글

  • Measurement Scale의 중요성: 변수의 측정척도가 통계분석 방법을 결정하는 이유
  • Nominal과 Ordinal Variable의 차이: 범주형 변수의 순서가 분석에 미치는 영향
  • Interval과 Ratio Scale의 차이: 연속형 변수에서 절대적 0이 중요한 이유
  • 변수 유형과 통계모형의 관계: ANOVA·Regression·Logistic Regression 선택 기준
  • Simple Linear Regression의 구조: 하나의 Predictor로 Response를 설명하는 원리

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Fundamental Statistical Concepts
  • Overview of Statistical Models
  • Analysis of Variance
  • Regression and Logistic Regression

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.