본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

Distribution을 먼저 확인해야 하는 이유: 데이터의 위치·산포·형태를 점검하는 과정

읽는 시간 약 55분

통계분석에서 Mean, Standard Deviation, p-value 같은 숫자를 계산하는 것은 중요합니다.

하지만 숫자만으로 Data의 전체 모습을 이해할 수는 없습니다.

예를 들어 두 Dataset의 Mean과 Standard Deviation이 비슷하더라도 실제 Distribution은 다음처럼 전혀 다를 수 있습니다.

  • 하나의 중심에 모인 Distribution
  • 한쪽으로 심하게 치우친 Distribution
  • 두 개의 Peak를 가진 Distribution
  • Extreme Value가 존재하는 Distribution

따라서 본격적인 Statistical Model을 적용하기 전에 먼저 Distribution을 확인하는 과정이 필요합니다.

Distribution을 확인한다는 것은 Data가 어디에 위치하고, 얼마나 퍼져 있으며, 어떤 형태로 분포하는지를 함께 살펴보는 것입니다.

첨부 교재의 Picturing Distributions에서도 Sample Distribution을 평가할 때 Histogram, Normal Probability Plot, Box Plot 등을 이용하며, Skewness와 Kurtosis 같은 Shape Measure를 함께 확인하도록 설명합니다.

Distribution이란 무엇인가?

Distribution은 Variable의 값들이 전체 Data 안에서 어떻게 나타나고 퍼져 있는지를 보여주는 구조입니다.

예를 들어 시험점수가 다음과 같다고 가정해보겠습니다.

60

70

75

80

85

90

이 숫자 목록만 보는 것보다 다음 질문을 하는 것이 중요합니다.

  • 어느 값 근처에 Observation이 많이 모여 있는가?
  • 값은 얼마나 넓게 퍼져 있는가?
  • 한쪽으로 치우쳐 있는가?
  • Extreme Value가 존재하는가?
  • 하나의 Peak가 있는가, 여러 Peak가 있는가?

이 모든 정보가 Distribution에 포함됩니다.

Distribution을 이해하는 세 가지 기본 요소

Data Distribution을 볼 때 가장 먼저 다음 세 가지를 생각할 수 있습니다.

Location

어디에 위치하는가?

Spread

얼마나 퍼져 있는가?

Shape

어떤 형태인가?

즉:

Distribution

=

Location + Spread + Shape

의 관점으로 이해할 수 있습니다.

Location이란 무엇인가?

Location은 Data가 대략 어느 값 주변에 위치하는지를 나타냅니다.

대표적인 Statistic은 다음과 같습니다.

  • Mean
  • Median
  • Mode

예를 들어:

Mean = 70

Median = 69

라면 Data의 중심이 70 근처에 있음을 알 수 있습니다.

하지만 이것만으로 Distribution 전체를 알 수는 없습니다.

Spread란 무엇인가?

Spread는 Observation들이 Center 주변에서 얼마나 넓게 퍼져 있는지를 나타냅니다.

대표적으로:

  • Range
  • Variance
  • Standard Deviation
  • Interquartile Range

등을 사용할 수 있습니다.

예를 들어 두 Dataset의 Mean이 모두 70이라도:

Dataset A

SD = 3

Dataset B

SD = 25

라면 실제 Variability는 크게 다릅니다.

즉 Location과 Spread는 서로 다른 정보를 제공합니다.

Shape란 무엇인가?

Shape는 Distribution의 전체적인 형태를 의미합니다.

대표적으로 다음과 같은 형태가 존재할 수 있습니다.

  • Symmetric
  • Right-Skewed
  • Left-Skewed
  • Bimodal
  • Multimodal
  • Heavy-Tailed
  • Light-Tailed

첨부 교재에서도 실제 Data Distribution이 반드시 Normal Distribution과 같지는 않으며, Sample Distribution의 Shape를 Normal Distribution과 비교할 때 Skewness와 Kurtosis를 확인할 수 있다고 설명합니다.

왜 Mean만 보면 Distribution을 놓칠 수 있을까?

다음 두 Dataset을 비교해보겠습니다.

Dataset A

48

49

50

51

52

Dataset B

10

30

50

70

90

두 Dataset의 Mean은 모두 50입니다.

하지만 Dataset A는 매우 좁게 모여 있고 Dataset B는 넓게 퍼져 있습니다.

즉 Mean 하나는 Center만 보여줄 뿐 Spread를 보여주지 않습니다.

Mean과 Standard Deviation까지 같으면 충분할까?

그렇지도 않습니다.

Mean과 Standard Deviation이 동일하거나 비슷한 두 Dataset이라도 Shape가 다를 수 있습니다.

예를 들어 한 Dataset은:

Single Peak

를 가질 수 있고,

다른 Dataset은:

Two Peaks

를 가질 수 있습니다.

또 하나는 Symmetric하고 다른 하나는 Extreme Tail을 가질 수 있습니다.

따라서 Summary Statistics만으로 Distribution 전체를 완전히 표현할 수 없습니다.

Statistic은 Distribution을 압축해서 보여주지만, 압축 과정에서 Shape 정보가 사라질 수 있습니다.

그래서 Visualization이 필요한 이유

Distribution은 Graph를 보면 훨씬 쉽게 이해할 수 있습니다.

첨부 교재에서는 Distribution을 살펴보기 위한 대표적인 Graphical Display로 다음 세 가지를 제시합니다.

  • Histogram
  • Normal Probability Plot
  • Box Plot

각 Graph는 서로 다른 Distribution 정보를 보여줍니다.

Histogram이란 무엇인가?

Histogram은 Continuous Data를 여러 구간으로 나눈 뒤 각 구간에 Observation이 얼마나 존재하는지를 표시합니다.

예를 들어 Score Range가:

0~100

이라면:

0~10

10~20

20~30

처럼 Bin을 만들 수 있습니다.

그리고 각 Bin의 Frequency를 표시합니다.

Histogram으로 무엇을 확인할 수 있을까?

Histogram을 보면 다음을 확인할 수 있습니다.

  • Center
  • Spread
  • Skewness
  • Peak의 수
  • Empty Area
  • Extreme Tail

예를 들어 대부분 Data가 왼쪽에 몰리고 오른쪽으로 긴 Tail이 있다면 Right-Skewed Distribution을 의심할 수 있습니다.

Histogram의 Peak는 무엇을 의미할까?

Peak는 Observation이 많이 몰려 있는 영역입니다.

하나의 명확한 Peak가 있다면 Unimodal Distribution일 수 있습니다.

두 개의 Peak가 있다면 Bimodal Distribution일 수 있습니다.

여러 Peak가 있다면 Multimodal Distribution일 수 있습니다.

첨부 교재에서도 Rectangular, Bimodal, Multimodal Distribution 등이 Kurtosis 해석과 연결될 수 있다고 설명합니다.

Bimodal Distribution은 왜 중요할까?

Bimodal Distribution은 서로 다른 두 Subgroup이 섞여 있을 가능성을 생각하게 합니다.

예를 들어 전체 Height Distribution에 두 Peak가 있다면:

  • Gender Group
  • Age Group
  • 다른 Population

등이 섞였을 수 있습니다.

하지만 두 Peak가 보인다고 해서 원인을 바로 단정할 수는 없습니다.

추가적인 Group Variable과 Data Structure를 확인해야 합니다.

Histogram의 Bin 크기에 따라 Shape가 달라 보일 수 있을까?

그렇습니다.

Bin을 너무 넓게 설정하면 중요한 Pattern이 사라질 수 있습니다.

반대로 Bin을 너무 좁게 설정하면 Random Noise가 많아 보일 수 있습니다.

따라서 Histogram은 강력한 Visualization이지만 Bin 설정에 따라 시각적 인상이 달라질 수 있다는 점도 기억해야 합니다.

Kernel Density Curve란 무엇인가?

첨부 교재의 Distribution Analysis Example에서는 Histogram과 함께 Kernel Density Curve를 사용할 수 있다고 설명합니다.

Kernel Density Curve는 Histogram을 보다 Smooth하게 표현한 형태로 이해할 수 있으며 Sample Distribution의 대략적인 Shape를 Normal Distribution과 비교하는 데 도움을 줄 수 있습니다.

즉:

Histogram

Bin 기반 Distribution

그리고:

Kernel Density Curve

Smoothed Distribution Shape

를 함께 확인할 수 있습니다.

Normal Distribution이란 무엇인가?

Normal Distribution은 통계학에서 매우 중요한 Symmetric Bell-Shaped Distribution입니다.

Mean을 중심으로 좌우가 대칭적인 형태를 가집니다.

많은 Statistical Method에서 Normality 또는 Approximate Normality가 중요한 역할을 하기 때문에 실제 Data가 Normal Distribution과 얼마나 비슷한지를 확인하는 경우가 많습니다.

모든 Data는 Normal Distribution을 따라야 할까?

아닙니다.

첨부 교재에서도 Data Distribution이 Normal처럼 보이지 않을 수 있으며 Population이 분포할 수 있는 형태는 매우 다양하다고 설명합니다.

예를 들어 다음 Variable은 자연스럽게 Skewed할 수 있습니다.

  • Income
  • Hospital Stay
  • Transaction Amount
  • Waiting Time

따라서:

Normal이 아님

=

Data가 잘못됨

은 아닙니다.

그러면 왜 Normal Distribution과 비교할까?

Normal Distribution은 여러 Statistical Method의 이론적 기준으로 사용되기 때문입니다.

또 Normal Distribution과 비교하면 실제 Data Shape를 설명하기 쉽습니다.

예를 들어:

  • Right Skew
  • Left Skew
  • Heavy Tail
  • Light Tail

등을 Normal Distribution과 비교하여 이해할 수 있습니다.

Symmetric Distribution이란 무엇인가?

Distribution이 Center를 기준으로 좌우가 비슷한 구조입니다.

예를 들어 Mean과 Median이 비슷하고 Histogram의 좌우 Shape가 비슷하다면 Symmetry 가능성을 생각할 수 있습니다.

하지만 Mean과 Median이 비슷하다는 사실만으로 완벽한 Symmetry를 증명할 수는 없습니다.

Graph를 함께 확인해야 합니다.

Skewness란 무엇인가?

Skewness는 Distribution의 비대칭성을 나타내는 Statistic입니다.

첨부 교재에서는 Sample Distribution의 Shape를 Normal Distribution과 비교하기 위한 Measure 중 하나로 Skewness를 제시합니다.

쉽게 표현하면:

Skewness ≈ 0

대칭적인 Distribution 가능

Positive Skewness

Right-Skewed 가능

Negative Skewness

Left-Skewed 가능

입니다.

Right-Skewed Distribution이란?

Observation 대부분은 낮은 값 주변에 위치하지만 일부 큰 값이 오른쪽으로 긴 Tail을 만드는 Distribution입니다.

예:

Income

대부분 중간 Income

일부 매우 높은 Income

이 경우 Mean이 높은 값의 영향을 받아 Median보다 커질 수 있습니다.

Left-Skewed Distribution이란?

Observation 대부분은 높은 값 근처에 있지만 일부 낮은 값이 왼쪽으로 긴 Tail을 만드는 Distribution입니다.

이 경우 Mean이 낮은 Extreme Value의 영향을 받아 Median보다 작아질 수 있습니다.

즉 Skewness는 Mean과 Median 관계를 이해하는 데도 도움을 줍니다.

Skewness 값 하나만 보고 Distribution을 판단해도 될까?

충분하지 않습니다.

Skewness Statistic은 Distribution Shape를 숫자로 요약합니다.

하지만 다음과 같은 정보는 놓칠 수 있습니다.

  • Bimodal Pattern
  • Isolated Outlier
  • Gap
  • Cluster

따라서:

Skewness Statistic

Histogram

Box Plot

을 함께 보는 것이 좋습니다.

Kurtosis란 무엇인가?

Kurtosis는 Distribution의 Tail이나 Peak 특성과 관련된 Shape Measure입니다.

첨부 교재에서는 Normal Distribution과 Sample Distribution을 비교하기 위한 또 하나의 Statistic으로 Kurtosis를 설명합니다.

SAS Output에서는 Normal Distribution과 비교하기 쉽게 조정된 Kurtosis를 사용합니다.

SAS에서 Normal Distribution의 Kurtosis는 왜 0일까?

일반적인 정의에서는 Normal Distribution의 Kurtosis가 3입니다.

하지만 첨부 교재에서는 SAS가 Report할 때 3을 빼는 방식을 사용하여 Normal Distribution의 Reported Kurtosis가 0이 되도록 한다고 설명합니다.

따라서 SAS Output에서:

Kurtosis ≈ 0

이면 Normal Distribution과 Tail/Peak 구조가 비슷한지 평가할 때 하나의 기준으로 사용할 수 있습니다.

Positive Kurtosis는 무엇을 의미할까?

첨부 교재에서는 Positive Kurtosis를 Leptokurtic이라고 설명합니다.

Symmetric Distribution이라는 조건에서:

  • Normal보다 Extreme Tail Observation이 많거나
  • Peak가 더 높을 수 있습니다.

이러한 Distribution은 Heavy-Tailed 또는 Outlier-Prone Distribution이라고 불리기도 합니다.

Negative Kurtosis는 무엇을 의미할까?

Negative Kurtosis는 Platykurtic Distribution과 연결됩니다.

Symmetric한 경우 Normal Distribution보다:

  • Tail Observation이 적거나
  • Peak가 더 Flat할 수 있습니다.

첨부 교재에서는 Rectangular, Bimodal, Multimodal Distribution이 Negative Kurtosis를 가질 수 있다고 설명합니다.

Kurtosis는 눈으로 쉽게 판단할 수 있을까?

첨부 교재에서도 Kurtosis는 Visual Assessment가 어려운 경우가 많다고 설명합니다.

따라서 Histogram만 보고:

“Kurtosis가 높다.”

라고 단정하기보다 SAS에서 계산된 Statistic과 Distribution Plot을 함께 확인하는 것이 좋습니다.

Normal Probability Plot이란 무엇인가?

Normal Probability Plot은 실제 Data가 Normal Distribution과 얼마나 비슷한지 시각적으로 확인하는 방법입니다.

첨부 교재에서는 Vertical Axis에 실제 Data Value가 표시되고 Horizontal Axis에는 Standard Normal Distribution에서 기대되는 Percentile이 표시된다고 설명합니다.

Data가 Normal Distribution에 가까우면 Observation들이 Reference Line 주변에 위치하는 형태를 보일 수 있습니다.

Normal Probability Plot에서 무엇을 볼까?

첨부 교재에서는 다음과 같은 Pattern Example을 제시합니다.

  1. Normal Distribution
  2. Right-Skewed Distribution
  3. Left-Skewed Distribution
  4. Light-Tailed Distribution
  5. Heavy-Tailed Distribution

즉 단순히 Normal인지 아닌지만 보는 것이 아니라 어떤 방식으로 Normal에서 벗어나는지를 확인하는 데도 도움이 됩니다.

점들이 직선에서 벗어나면 무조건 분석을 중단해야 할까?

아닙니다.

Plot이 Normality에서 벗어나는 Pattern을 보여준다면:

  • Distribution Shape 확인
  • Extreme Value 확인
  • Sample Size 고려
  • Statistical Model Assumption 확인

등을 추가로 검토해야 합니다.

Normal하지 않다는 사실만으로 Data를 삭제하거나 분석을 포기하는 것은 적절하지 않습니다.

Box Plot은 Distribution에서 무엇을 보여줄까?

첨부 교재에서는 Box Plot을 Data Variability와 Extreme Data Value에 대한 정보를 제공하는 Graph라고 설명합니다.

Box Plot은 일반적으로:

  • Q1
  • Median
  • Q3
  • IQR
  • Potential Outlier

를 보여줍니다.

따라서 Distribution의 Center, Spread, Symmetry를 빠르게 확인할 수 있습니다.

Box의 의미는 무엇인가?

Box는 일반적으로 Q1과 Q3 사이를 나타냅니다.

즉 Distribution의 **Middle 50%**입니다.

첨부 교재에서도 Box가 25th와 75th Percentile 사이의 중앙 50% Data를 나타낸다고 설명합니다.

따라서 Box가 길수록 중앙 Data의 Spread가 크다고 이해할 수 있습니다.

Median Line은 무엇을 보여줄까?

Box 안의 Median Line은 50th Percentile입니다.

Median이 Box의 가운데쯤 위치하면 Central Distribution이 비교적 Symmetric할 가능성을 생각할 수 있습니다.

반대로 Median이 Q1이나 Q3 쪽에 치우쳐 있다면 비대칭적인 구조일 수 있습니다.

Box Plot에서 Mean도 볼 수 있을까?

첨부 교재에서 제시하는 Box Plot Diagram에서는 Mean을 별도의 Symbol로 나타냅니다.

Mean과 Median의 위치를 비교하면 Distribution Symmetry에 대한 추가적인 정보를 얻을 수 있습니다.

예를 들어 Mean과 Median이 크게 차이 난다면 Skewness나 Extreme Value를 확인할 필요가 있습니다.

Whisker는 무엇을 의미할까?

첨부 교재에서는 Whisker가 Box에서 최대 1.5 IQR 거리까지 Data가 존재하는 범위로 확장될 수 있다고 설명합니다.

그리고 이 범위를 넘어선 값은 개별 Plot Symbol로 표시될 수 있습니다.

즉:

Box

Middle 50%

Whisker

Typical Tail Range

Individual Point

Potential Extreme Value

와 같은 구조입니다.

Box Plot에서 표시된 Outlier는 무조건 삭제해야 할까?

아닙니다.

1.5 IQR 밖의 Observation은 Potential Outlier를 탐색하기 위한 신호입니다.

그 값은 다음 중 하나일 수 있습니다.

  • Data Entry Error
  • Measurement Error
  • 실제 Extreme Observation
  • Rare but Valid Case

따라서 Source와 Context를 확인해야 합니다.

Graph에서 이상값으로 표시되었다는 것은 확인해야 한다는 의미이지 삭제해야 한다는 의미가 아닙니다.

Histogram과 Box Plot은 어떤 차이가 있을까?

두 Graph 모두 Distribution을 보여주지만 강조점이 다릅니다.

Histogram

전체 Shape

Peak

Skewness

Gap

Box Plot

Quartile 기반 Summary

Median

IQR

Extreme Value

입니다.

따라서 두 Graph를 함께 사용하면 서로 보완됩니다.

Normal Probability Plot은 어떤 정보를 추가할까?

Histogram과 Box Plot이 실제 Data Distribution 자체를 보여준다면 Normal Probability Plot은 Normal Distribution이라는 Reference와 비교하는 데 초점을 맞춥니다.

즉:

Histogram

실제 Shape

Box Plot

Center / Spread / Outlier

Normal Probability Plot

Normality Pattern

이라고 이해할 수 있습니다.

세 Graph를 함께 보면 좋은 이유

첨부 교재의 Distribution Analysis Task도 이 세 Graph를 함께 생성할 수 있도록 구성되어 있습니다.

전체적으로:

Histogram

Shape 확인

Probability Plot

Normality 확인

Box Plot

Quartile / Extreme Value 확인

을 이용해 Distribution을 보다 입체적으로 평가할 수 있습니다.

Distribution Analysis Task란 무엇인가?

첨부 교재에서는 SAS Enterprise Guide의 Distribution Analysis Task가 단순 Descriptive Statistics뿐 아니라 Variable Distribution에 대한 더 자세한 정보를 제공한다고 설명합니다.

이를 이용해 다음을 생성할 수 있습니다.

  • Statistical Tables
  • Histogram
  • Normal Probability Plot
  • Box Plot

즉 Summary Statistics Task보다 Distribution Shape를 더 적극적으로 탐색할 수 있습니다.

Distribution Analysis를 왜 Summary Statistics 다음에 사용할까?

Summary Statistics에서는 다음과 같은 Numeric Information을 얻을 수 있습니다.

  • Mean
  • SD
  • Minimum
  • Maximum
  • Quartile

하지만 숫자만으로 Shape를 완전히 파악하기 어렵습니다.

따라서:

Summary Statistics

숫자로 Data 요약

그 다음:

Distribution Analysis

Graph를 이용해 Shape 확인

이라는 흐름이 자연스럽습니다.

SAS에서 Normal Reference Curve를 Histogram에 추가할 수 있을까?

첨부 교재에서는 Histogram에 Normal Reference Curve를 추가하여 Sample Distribution과 Normal Distribution을 비교할 수 있다고 설명합니다.

이를 통해 실제 Data가 Normal Curve와 비슷한 Shape를 보이는지 시각적으로 확인할 수 있습니다.

Normality Test도 같이 수행할 수 있을까?

첨부 교재에서는 Normal Reference Curve를 요청하면 Normality를 평가하는 Table도 제공될 수 있다고 설명합니다.

예로 다음 Test를 제시합니다.

  • Kolmogorov-Smirnov
  • Anderson-Darling
  • Cramer-von Mises

이러한 Test에서는 Null Hypothesis가 Distribution is Normal로 설정됩니다.

Normality Test의 p-value가 높으면 무엇을 의미할까?

첨부 교재의 설명처럼 Null Hypothesis가 Normal Distribution이라면 높은 p-value는 Data가 Normality와 명백히 충돌한다는 충분한 Evidence가 없다는 방향으로 해석할 수 있습니다.

하지만 여기서 매우 중요한 주의점이 있습니다.

Normality는 p-value 하나만으로 판단해서는 안 됩니다.

Graph와 Sample Size를 함께 고려해야 합니다.

Sample Size가 크면 Normality Test가 민감해질 수 있다

매우 큰 Sample에서는 실제 분석에 큰 문제가 되지 않을 정도의 작은 Distribution Difference도 Statistical Test에서 검출될 수 있습니다.

반대로 작은 Sample에서는 실제 Non-Normality를 발견할 Power가 부족할 수 있습니다.

따라서:

Normality Test

Histogram

Probability Plot

분석 목적

을 함께 고려하는 것이 좋습니다.

Distribution이 Normal하지 않으면 무조건 Transformation해야 할까?

아닙니다.

먼저 다음을 확인해야 합니다.

  • 어떤 Analysis를 할 것인가?
  • Normality Assumption이 무엇에 적용되는가?
  • Sample Size는 어떤가?
  • Extreme Value가 원인인가?
  • 자연스럽게 Skewed한 Variable인가?

필요한 경우 Transformation을 고려할 수 있지만 자동적인 해결책은 아닙니다.

Raw Data의 Normality와 Residual Normality는 같은 개념일까?

아닙니다.

특히 Regression이나 ANOVA에서는 Raw Response 자체보다 Model Residual의 Distribution이 Assumption과 더 직접적으로 연결되는 경우가 있습니다.

따라서:

“Response Histogram이 완벽한 Normal이 아니다.”

라는 이유만으로 Regression이나 ANOVA가 자동으로 불가능하다고 단정하면 안 됩니다.

이후 Residual Analysis에서 더 자세히 다루게 됩니다.

Statistical Model 전에 Distribution을 보는 이유

Data Shape는 Model Choice와 Interpretation에 영향을 줄 수 있습니다.

예를 들어:

Symmetric Continuous Data

Mean + SD가 유용

하지만:

Strongly Skewed Data

Median + IQR 고려

또:

Extreme Outlier

Regression / Correlation 영향 확인

즉 Distribution은 Descriptive Statistics와 Inferential Statistics를 연결하는 중간 단계입니다.

t-Test 전에 Distribution을 확인해야 하는 이유

t-Test는 Mean Difference를 분석합니다.

그런데 Data가 매우 Skewed하거나 Extreme Value가 존재한다면 Mean과 Variance Estimate가 영향을 받을 수 있습니다.

따라서 Group별:

  • Histogram
  • Box Plot
  • Mean
  • Median
  • SD

등을 먼저 확인하는 것이 좋습니다.

ANOVA 전에 Distribution을 확인해야 하는 이유

ANOVA에서는 여러 Group의 Mean을 비교합니다.

따라서 각 Group에서 다음을 확인해야 합니다.

  • Sample Size
  • Center
  • Variability
  • Outlier
  • Distribution Shape

특히 특정 Group만 Variance가 매우 크거나 Extreme Value가 많다면 ANOVA Result Interpretation에 영향을 줄 수 있습니다.

Regression 전에 Distribution을 확인해야 하는 이유

Regression에서는 Predictor와 Response의 개별 Distribution뿐 아니라 두 Variable 사이 Relationship도 중요합니다.

따라서:

Univariate Distribution

각 Variable 확인

그 다음:

Scatter Plot

두 Variable 관계 확인

으로 확장해야 합니다.

첨부 교재도 Regression Chapter에서 본격적인 Regression 전에 Exploratory Data Analysis를 배치하고 있습니다.

Logistic Regression에서도 Distribution이 중요할까?

Response가 Binary라면 Continuous Response처럼 Histogram을 보는 방식과는 다릅니다.

하지만 Predictor Distribution은 여전히 중요합니다.

예를 들어 Continuous Predictor에 Extreme Value가 존재할 수 있고 Categorical Predictor에서는 Rare Category가 있을 수 있습니다.

따라서 Distribution 확인은 Model 종류와 관계없이 기본적인 Data Review 과정입니다.

Category Variable의 Distribution은 어떻게 확인할까?

Categorical Variable에서는 Histogram보다 Frequency Table이나 Bar Chart가 더 적절합니다.

예를 들어:

Treatment A = 490

Treatment B = 10

이라면 매우 불균형한 Distribution입니다.

따라서 Distribution이라는 개념은 Continuous Variable에만 적용되는 것이 아닙니다.

Categorical Distribution에서 무엇을 확인할까?

대표적으로 다음을 확인할 수 있습니다.

  • Frequency
  • Percentage
  • Missing Category
  • Unexpected Category
  • Rare Category

예를 들어 Region Variable에 예상하지 못한 Category가 나타나면 Coding Error일 수 있습니다.

Distribution이 갑자기 바뀌면 Data Issue일 수 있을까?

가능합니다.

예를 들어 지난 Dataset에서는 Weight Distribution이:

50~100kg

근처였는데 새 Dataset에서:

500~1000

으로 이동했다고 가정해보겠습니다.

가능한 원인은:

  • Unit Change
  • Data Import Error
  • Population Change
  • Coding Change

등입니다.

즉 Distribution Monitoring은 Data Quality Control에도 활용할 수 있습니다.

Data Update 전후 Distribution을 비교하면 좋은 이유

Data Cleaning이나 새로운 Data Transfer 후 Distribution을 다시 확인하면 예상하지 못한 변화를 발견할 수 있습니다.

예를 들어:

Version 1

Mean = 70

SD = 8

Version 2

Mean = 150

SD = 90

이라면 Data Update 내용을 확인해야 합니다.

Data Version이 달라질 때 단순 Record Count뿐 아니라 Distribution을 비교하는 것도 중요합니다.

여러 Group의 Distribution을 같이 보면 무엇을 알 수 있을까?

예를 들어 Treatment A와 B를 비교할 때 Mean만 보면:

A Mean = 50

B Mean = 55

입니다.

하지만 Box Plot을 보면:

A는 45~55 근처에 집중

B는 0~100까지 넓게 분포

할 수 있습니다.

즉 5점 Mean Difference만으로는 두 Group의 실제 Data Pattern을 충분히 이해할 수 없습니다.

Overall Distribution만 보면 놓칠 수 있는 것

여러 Group을 합친 전체 Distribution이 이상해 보일 수 있습니다.

예를 들어 Male과 Female Height를 합치면 전체 Histogram이 넓거나 두 개의 Peak를 보일 수 있습니다.

Subgroup별로 나누면 각각 비교적 단순한 Distribution일 수 있습니다.

따라서 전체 Distribution뿐 아니라 Research Question과 관련된 Group별 Distribution도 확인해야 합니다.

Bimodal Distribution에서 Mean은 왜 조심해야 할까?

두 Peak가:

40

80

근처에 있다고 가정해보겠습니다.

전체 Mean은:

60

근처일 수 있습니다.

하지만 실제 Observation은 60 근처에 거의 없을 수도 있습니다.

즉 Mean이 Mathematical Center이기는 하지만 실제 Typical Observation을 대표하지 못할 수 있습니다.

이런 경우 Distribution Plot이 매우 중요합니다.

Extreme Value 하나가 Correlation을 만들 수도 있을까?

가능합니다.

대부분 Observation에서는 X와 Y 사이 관계가 거의 없는데 한 Extreme Observation 때문에 Strong Correlation처럼 보일 수 있습니다.

따라서 Correlation Coefficient를 계산하기 전에 Scatter Plot과 Distribution을 확인해야 합니다.

이는 이후 Correlation Cluster에서 더 자세히 다룰 수 있습니다.

Extreme Value가 Regression Line을 바꿀 수도 있을까?

가능합니다.

Predictor나 Response에서 멀리 떨어진 Observation이 Regression Line에 큰 영향을 줄 수 있습니다.

따라서 Distribution Review는 이후 Outlier와 Influential Observation Analysis로 연결됩니다.

모든 Extreme Value는 같은 영향력을 가질까?

아닙니다.

Response 방향으로 극단적인 Observation과 Predictor 방향으로 멀리 떨어진 Observation은 Regression에서 서로 다른 영향을 줄 수 있습니다.

따라서 단순 Box Plot Outlier 여부만으로 Regression Influence를 완전히 판단할 수 없습니다.

이후 Regression Diagnostics에서:

  • Outlier
  • Leverage
  • Influence

를 구분해야 합니다.

Distribution을 분석하기 전에 Unit을 확인해야 하는 이유

잘못된 Unit이 섞이면 Distribution 자체가 왜곡됩니다.

예를 들어 Weight Dataset에:

kg

lb

가 섞이면 Histogram이 두 개의 Peak처럼 보일 수 있습니다.

이것을 실제 Population의 Bimodality라고 잘못 해석할 수 있습니다.

따라서 Distribution의 이상 Pattern을 발견하면 Data Definition과 Unit을 먼저 확인해야 합니다.

Missing Value가 Distribution을 왜곡할 수 있을까?

그렇습니다.

특정 Range에서 Missing이 더 많이 발생하면 Observed Distribution이 실제 Population Distribution과 달라질 수 있습니다.

예를 들어 Severe Patient에서 Outcome Missing이 많다면 Analysis Dataset은 Mild Patient 쪽으로 치우칠 수 있습니다.

따라서 Distribution Interpretation에는 Missing Mechanism도 중요합니다.

Truncated Distribution이란 무엇일까?

연구 Inclusion Criteria나 Data Collection Rule 때문에 특정 범위 밖의 Data가 원래부터 들어오지 않는 경우가 있습니다.

예를 들어:

Age 65~80세만 Study에 포함

한다면 Age Distribution의 Minimum과 Maximum은 연구 설계에 의해 제한됩니다.

따라서 좁은 Distribution이 자연스러운 Population 특성인지 Study Design의 결과인지 구분해야 합니다.

Floor Effect와 Distribution

Scale Minimum에 Observation이 많이 몰리는 것을 Floor Effect라고 할 수 있습니다.

예를 들어 Score Range가:

0~100

인데 많은 Patient가 0~5에 몰려 있다면 Lower Boundary에서 Distribution이 압축되어 있습니다.

이 경우 Mean과 SD만으로 Data 특성을 충분히 표현하기 어려울 수 있습니다.

Ceiling Effect란 무엇인가?

반대로 Scale Maximum 근처에 Observation이 많이 몰리는 현상입니다.

시험이 너무 쉬워 대부분 95~100점을 받는 경우처럼:

Upper Boundary

에 Data가 집중됩니다.

Ceiling Effect는 Change Detection이나 Regression Relationship에도 영향을 줄 수 있습니다.

Distribution Shape가 Measurement Tool의 문제를 보여줄 수도 있다

예를 들어 Score가 특정 값에 과도하게 몰리거나 많은 Observation이 Minimum 또는 Maximum에 있다면 Measurement Instrument가 Population 차이를 충분히 구분하지 못하고 있을 가능성을 검토할 수 있습니다.

즉 Distribution은 단순 Statistical Shape가 아니라 Measurement Quality에 대한 정보를 제공하기도 합니다.

Date Distribution도 확인할 수 있을까?

가능합니다.

Study Visit Date나 Transaction Date를 시간축으로 Plot하면 특정 Period에 Data가 몰려 있는지 확인할 수 있습니다.

예를 들어 특정 Month의 Data가 완전히 비어 있다면:

  • Data Transfer 누락
  • System Downtime
  • 실제 Operation 중단

등을 검토할 수 있습니다.

Distribution Concept은 다양한 Variable에 적용될 수 있습니다.

SAS에서 Distribution을 확인하는 기본 흐름

첨부 교재의 Distribution Analysis 구조를 바탕으로 다음처럼 정리할 수 있습니다.

Analysis Variable 선택

Descriptive Statistics

Mean

SD

Min

Max

Skewness

Kurtosis

Histogram

Shape 확인

Normal Probability Plot

Normality Pattern 확인

Box Plot

Median / IQR / Extreme Value 확인

전체 Distribution 판단

첨부 교재의 Distribution Analysis Task는 이러한 Table과 Graph를 함께 생성하도록 구성되어 있습니다.

Distribution을 보고 어떤 질문을 해야 할까?

다음과 같은 순서가 유용합니다.

1. 값의 범위가 합리적인가?

Min / Max 확인

2. Center는 어디인가?

Mean / Median 확인

3. 얼마나 퍼져 있는가?

SD / IQR 확인

4. 대칭적인가?

Histogram / Mean vs Median 확인

5. Tail은 어떤가?

Skewness / Kurtosis 확인

6. Extreme Value가 있는가?

Box Plot 확인

7. Normality는 중요한가?

Analysis 목적과 Assumption 확인

Distribution을 먼저 확인한다는 것은 Normality만 확인한다는 뜻이 아니다

매우 중요한 부분입니다.

초보자는 Distribution Analysis를:

“Normal Distribution인지 확인하는 과정”

이라고 생각하기 쉽습니다.

하지만 더 넓은 목적이 있습니다.

Location

Spread

Shape

Extreme Value

Data Quality

를 전체적으로 확인해야 합니다.

Normality는 그중 하나의 요소일 뿐입니다.

Distribution Review의 목적은 Data를 Normal로 만들기 위한 것이 아니라 Data가 실제로 어떤 구조를 가지고 있는지 이해하는 것입니다.

Distribution이 이상하면 무엇부터 해야 할까?

바로 Transformation이나 Observation 삭제를 시도하기보다 다음 순서를 권할 수 있습니다.

Step 1

Raw Data 확인

Step 2

Unit / Coding 확인

Step 3

Data Entry Error 확인

Step 4

실제 Population 특성인지 확인

Step 5

Statistical Model Assumption 검토

Step 6

필요한 분석 방법 결정

즉 Shape 자체를 문제라고 생각하기보다 원인을 이해해야 합니다.

Transformation은 Distribution을 바꾸기 위한 방법일까?

일부 Skewed Continuous Data에서는 Log Transformation 같은 방법을 적용할 수 있습니다.

Transformation을 통해:

  • Skewness 감소
  • Variance 안정화
  • Relationship 단순화

등을 기대할 수 있는 경우가 있습니다.

하지만 Transformation은 Analysis 목적과 Data Meaning에 따라 결정해야 합니다.

단지 Histogram을 Normal처럼 보이게 하기 위해 기계적으로 적용해서는 안 됩니다.

Distribution이 Normal이면 분석이 항상 올바를까?

아닙니다.

Normality는 Statistical Analysis의 여러 조건 가운데 하나일 뿐입니다.

예를 들어 Regression에서는 다음도 중요합니다.

  • Linearity
  • Independence
  • Residual Variance
  • Influential Observation

따라서 Normal Distribution을 확인했다고 Model Validation이 끝나는 것은 아닙니다.

Distribution이 Non-Normal이면 분석이 항상 틀릴까?

역시 아닙니다.

Statistical Method에 따라 Non-Normal Data에서도 적절하게 작동할 수 있습니다.

또 Sample Size와 Model Structure에 따라 Normality 요구사항이 달라질 수 있습니다.

따라서:

Normal / Non-Normal

만으로 Model을 선택하거나 버려서는 안 됩니다.

Distribution Analysis와 Descriptive Statistics의 관계

Descriptive Statistics는:

숫자로 Distribution을 요약

합니다.

Distribution Analysis는:

그 숫자가 만들어지는 전체 Shape까지 탐색

합니다.

따라서 다음처럼 연결됩니다.

Descriptive Statistics

Mean

Median

SD

IQR

Distribution Visualization

Histogram

Box Plot

Probability Plot

Data Understanding

입니다.

Distribution을 확인한 뒤 Inferential Statistics로 넘어간다

전체 Statistical Workflow는 다음과 같이 이해할 수 있습니다.

Raw Data

Data Validation

Descriptive Statistics

Center / Spread

Distribution Analysis

Shape / Outlier / Normality

Statistical Model Selection

t-Test / ANOVA / Regression 등

Model Diagnostics

Interpretation

이 흐름을 따르면 단순히 SAS Menu를 실행하는 것이 아니라 Data Structure를 이해하면서 분석할 수 있습니다.

흔한 오해 정리

“Mean과 SD를 알면 Distribution을 모두 안다”

아닙니다.

Normal Distribution처럼 특정 Shape가 주어진 경우에는 강력하지만 일반 Data에서는 Shape가 다를 수 있습니다.

“Distribution을 확인한다는 것은 Normality Test를 하는 것이다”

아닙니다.

Location, Spread, Shape, Extreme Value 등을 모두 확인해야 합니다.

“Normal Distribution이 아니면 Data가 잘못되었다”

아닙니다.

Population 자체가 Skewed할 수 있습니다.

“Histogram만 보면 Distribution을 완전히 알 수 있다”

아닙니다.

Bin 설정에 영향을 받을 수 있으며 Quartile이나 Normality Pattern을 함께 확인하는 것이 좋습니다.

“Box Plot의 모든 점은 Data Error다”

아닙니다.

Potential Extreme Observation일 뿐 실제 Data일 수도 있습니다.

“Normality Test p-value가 높으면 완벽한 Normal Distribution이다”

그렇게 단정할 수 없습니다.

Graph, Sample Size, 분석 목적을 함께 고려해야 합니다.

“Normality Test p-value가 작으면 해당 Data는 분석할 수 없다”

아닙니다.

사용할 Statistical Model과 Assumption을 별도로 검토해야 합니다.

“Skewness가 0이면 반드시 Normal Distribution이다”

아닙니다.

Symmetric하지만 Normal이 아닌 Distribution도 존재할 수 있습니다.

“Mean과 Median이 같으면 Normal Distribution이다”

아닙니다.

Bimodal 또는 다른 Symmetric Distribution도 가능할 수 있습니다.

“Outlier를 제거하면 Distribution이 좋아진다”

반드시 그렇지 않습니다.

Outlier의 원인을 먼저 확인해야 합니다.

Distribution Review의 전체 구조

지금까지의 내용을 하나로 정리하면 다음과 같습니다.

Data

Location

Mean

Median

Spread

SD

IQR

Range

Shape

Symmetry

Skewness

Kurtosis

Visualization

Histogram

Probability Plot

Box Plot

Extreme Value

Potential Outlier 확인

Assumption

Normality 등 검토

Statistical Analysis

첨부 교재에서도 Sample Distribution을 Normal Distribution과 비교하기 위해 Skewness와 Kurtosis를 사용하고, Histogram·Normal Probability Plot·Box Plot을 이용하여 Distribution을 시각적으로 평가하도록 설명합니다.

왜 Distribution을 먼저 확인해야 할까?

앞으로 다루게 될 Statistical Method들이 Distribution과 밀접하게 연결되기 때문입니다.

Confidence Interval

Sample Mean과 Variability 이용

t-Test

Mean Difference와 Distribution Assumption

ANOVA

Group Mean과 Within-Group Variation

Correlation

Outlier와 Relationship Shape 영향

Regression

Residual Distribution과 Model Assumption

따라서 Statistical Test부터 실행하는 것보다 먼저 Data가 어떤 구조인지 이해하는 것이 중요합니다.

핵심 정리

Distribution은 Data Value들이 전체 Sample에서 어떻게 위치하고 퍼져 있는지를 보여주는 구조입니다.

이를 이해할 때는 다음 세 요소가 기본입니다.

Location

Data가 어디에 있는가?

Spread

얼마나 퍼져 있는가?

Shape

어떤 형태를 가지는가?

하지만 실제 Distribution Review에서는 여기에:

  • Skewness
  • Kurtosis
  • Extreme Value
  • Normality
  • Data Quality

까지 함께 살펴보는 것이 좋습니다.

첨부 교재에서는 Sample Distribution Shape를 Normal Distribution과 비교하기 위한 Statistic으로 Skewness와 Kurtosis를 제시하고 있습니다.

또 Distribution을 Graphically 평가하는 방법으로:

Histogram

전체 Shape 확인

Normal Probability Plot

Normal Distribution과의 차이 확인

Box Plot

Median, IQR, Extreme Value 확인

을 제시합니다.
SAS Enterprise Guide의 Distribution Analysis Task에서도 이러한 Statistical Table과 Graph를 함께 생성하여 Variable Distribution을 자세히 살펴볼 수 있습니다.

가장 중요한 원칙은 다음과 같습니다.

Distribution을 확인하는 목적은 Data를 억지로 Normal Distribution으로 만드는 것이 아니라, Statistical Model을 적용하기 전에 Data가 실제로 어떤 구조를 가지고 있는지 이해하는 것입니다.

즉 좋은 분석의 흐름은:

Data

Summary Statistics

Distribution 확인

Data Quality와 Assumption 검토

Statistical Model

순서로 이어집니다.

함께 읽으면 좋은 글

  • Descriptive Statistics의 목적: 본격적인 분석 전에 데이터를 진단해야 하는 이유
  • Mean·Median·Mode의 차이: 데이터 분포에 따라 중심값을 선택하는 기준
  • Variance와 Standard Deviation의 의미: 평균만으로 데이터 변동성을 설명할 수 없는 이유
  • Range와 Interquartile Range의 차이: 이상치 영향을 줄여 산포를 측정하는 방법
  • Skewness와 Extreme Value의 영향: 비대칭 분포와 극단값이 통계량을 왜곡하는 방식

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Introduction to Statistics
  • Picturing Distributions
  • Data Distributions Compared to Normal
  • Skewness and Kurtosis
  • Histograms
  • Normal Probability Plots
  • Box Plots
  • Distribution Analysis Task

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.