본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

Percentile과 Quartile의 구조: 데이터의 상대적 위치와 분포를 해석하는 방식

읽는 시간 약 47분

데이터를 분석할 때 Mean이나 Median만으로는 각 Observation이 전체 Distribution에서 어느 위치에 있는지 알기 어렵습니다.

예를 들어 시험점수가 85점이라고 가정해보겠습니다.

85점이라는 숫자만 보면 점수가 높은지 낮은지 어느 정도 감은 잡을 수 있지만, 전체 학생 가운데 상위 몇 %인지까지는 알 수 없습니다.

이때 사용하는 개념이 Percentile과 Quartile입니다.

Percentile은 하나의 값이 전체 Data Distribution에서 어느 상대적 위치에 있는지를 나타내고, Quartile은 Data를 네 부분으로 나누는 대표적인 Percentile 지점입니다.

첨부 교재에서도 Percentile은 Data Value의 일정 비율보다 높은 위치를 나타내는 값으로 설명하고, 대표적으로 25th, 50th, 75th Percentile을 각각 First Quartile, Median, Third Quartile로 연결합니다.

Percentile이란 무엇인가?

Percentile은 정렬된 Data 안에서 상대적인 위치를 표현합니다.

예를 들어 25th Percentile은 전체 Data의 약 25%가 그 값 이하에 위치하는 지점으로 이해할 수 있습니다.

마찬가지로:

50th Percentile

전체 Data의 중앙 위치

Median

입니다.

즉 Percentile은 단순한 절대값이 아니라 전체 Distribution 안에서의 위치 정보를 제공합니다.

왜 절대값보다 상대적 위치가 중요할까?

시험점수 80점을 생각해보겠습니다.

시험 A에서 대부분 학생이:

90~100점

이라면 80점은 낮은 편입니다.

반대로 시험 B에서 대부분 학생이:

40~70점

이라면 80점은 매우 높은 편일 수 있습니다.

즉 같은 80점이라도 Population이나 Sample Distribution에 따라 의미가 달라집니다.

Percentile은 값 자체보다 그 값이 다른 Observation들과 비교해 어디에 위치하는지를 보여줍니다.

Percentile을 쉽게 이해하는 방법

100명의 학생을 점수가 낮은 사람부터 높은 사람까지 줄 세운다고 생각해보겠습니다.

그러면 대략:

25번째 위치

25th Percentile 부근

50번째 위치

50th Percentile 부근

75번째 위치

75th Percentile 부근

으로 이해할 수 있습니다.

실제 Sample Percentile 계산은 사용하는 Definition과 Software Algorithm에 따라 조금 달라질 수 있지만 기본 개념은 정렬된 Data에서 상대적 위치를 찾는 것입니다.

첨부 교재의 Percentile Example

첨부 교재에서는 다음과 같은 정렬된 Data를 이용하여 Percentile을 설명합니다.

42

47

55

63

70

79

81

85

90

92

95

98

그리고 다음 값을 제시합니다.

  • 25th Percentile = 59
  • 50th Percentile = 80
  • 75th Percentile = 91

이 Example은 Percentile이 반드시 원래 Data에 존재하는 Observation 중 하나일 필요는 없다는 점도 보여줍니다.

Percentile 값이 실제 Data에 없어도 될까?

가능합니다.

위 교재 Example에서 59는 원래 Data 목록에 직접 존재하지 않습니다.

Percentile 계산 과정에서는 두 Observation 사이의 위치를 이용해 값을 결정할 수 있기 때문입니다.

따라서:

Percentile

반드시 실제 Observation

입니다.

Median도 Observation 수가 짝수인 경우 가운데 두 값의 평균처럼 실제 Dataset에 존재하지 않는 값이 될 수 있습니다.

50th Percentile이 Median인 이유

Data를 정렬했을 때 중앙을 기준으로 절반이 아래쪽, 절반이 위쪽에 위치합니다.

따라서:

50th Percentile

=

Median

입니다.

첨부 교재에서도 50th Percentile을 Median이라고 명시합니다.

즉 Median은 Central Tendency Statistic이면서 동시에 Percentile의 하나입니다.

Quartile이란 무엇인가?

Quartile은 Data를 네 부분으로 나누는 기준점입니다.

첨부 교재에서도 Quartiles divide your data into quarters라고 설명합니다.

대표적으로:

First Quartile

Q1

=

25th Percentile

Second Quartile

Q2

=

50th Percentile

=

Median

Third Quartile

Q3

=

75th Percentile

입니다.

Quartile의 전체 구조

정렬된 Data를 다음처럼 생각할 수 있습니다.

Lowest 25%

Q1

Second 25%

Median / Q2

Third 25%

Q3

Highest 25%

즉 Q1, Median, Q3가 Distribution을 네 부분으로 나누는 Boundary 역할을 합니다.

Q1은 무엇을 알려줄까?

Q1은 25th Percentile입니다.

쉽게 말하면 Data의 Lower Quarter를 구분하는 지점입니다.

예를 들어:

Q1 = 50

이라면 전체 Data의 약 25%가 50 이하에 위치하는 구조로 이해할 수 있습니다.

그리고 나머지 약 75%는 그보다 같거나 높은 영역에 위치합니다.

Median은 무엇을 알려줄까?

Median은 50th Percentile입니다.

즉 정렬된 Distribution의 중앙 위치입니다.

예를 들어:

Median = 70

이라면 Observation의 절반 정도가 70 이하, 절반 정도가 70 이상에 위치하는 구조로 이해할 수 있습니다.

Median은 Extreme Value에 Mean보다 덜 민감하기 때문에 Skewed Data에서도 중요한 Summary Statistic입니다.

Q3는 무엇을 알려줄까?

Q3는 75th Percentile입니다.

예를 들어:

Q3 = 90

이라면 Data의 약 75%가 90 이하에 위치하고 약 25%가 그보다 높은 위치에 있다고 이해할 수 있습니다.

따라서 Q3는 Distribution의 Upper Quarter를 구분합니다.

Percentile과 Percentage는 같은 것일까?

아닙니다.

매우 자주 혼동되는 개념입니다.

Percentage

전체 중 어떤 Group이 차지하는 비율

예:

100명 중 20명

20%

Percentile

정렬된 Data에서 어떤 값의 상대적 위치

예:

85th Percentile

Data Distribution에서 약 85%보다 높은 위치의 기준

즉:

Percentage

는 비율이고,

Percentile

은 위치입니다.

“90 Percentile”은 90점을 의미할까?

아닙니다.

90th Percentile은 Score가 90이라는 뜻이 아닙니다.

예를 들어 시험의 90th Percentile 값이 82점일 수도 있습니다.

이 의미는 82점이라는 Score가 해당 Distribution에서 매우 높은 상대적 위치에 있다는 것입니다.

즉:

Raw Score

82

Percentile Rank

90th Percentile

은 서로 다른 정보입니다.

Percentile Rank란 무엇일까?

특정 Observation이 전체 Distribution에서 어느 정도 위치에 있는지를 Percentile 형태로 표현한 것입니다.

예를 들어 한 학생이 90th Percentile에 있다면 그 학생의 Score가 Distribution의 매우 높은 위치에 있다는 의미입니다.

하지만 “다른 학생보다 정확히 90% 더 높은 점수”라는 뜻은 아닙니다.

Percentile은 상대적 순위이지 값의 상대적인 크기 비율을 의미하지 않습니다.

90th Percentile 값이 50th Percentile 값의 두 배라면?

그 사실 자체가 Percentile 개념에서 특별한 Ratio Interpretation을 제공하지는 않습니다.

Percentile은 위치를 표현합니다.

예를 들어:

50th Percentile = 50

90th Percentile = 100

이라고 해서 90th Percentile 사람이 Median 사람보다 능력이 두 배라고 단정할 수 없습니다.

Measurement Scale의 특성을 별도로 고려해야 합니다.

Percentile은 왜 Outlier 영향을 덜 받을까?

Percentile은 Data의 순서와 상대적 위치를 중심으로 계산합니다.

따라서 Maximum 값이 극단적으로 커지더라도 Median이나 Q1, Q3가 크게 변하지 않을 수 있습니다.

예를 들어:

10

20

30

40

50

에서:

50을 5000으로 바꾸더라도 Median의 위치는 크게 변하지 않습니다.

이 때문에 Quartile 기반 Statistic은 Extreme Value에 상대적으로 Robust합니다.

Quartile과 IQR은 어떻게 연결될까?

Q1과 Q3를 알면 Interquartile Range를 계산할 수 있습니다.

구조는:

IQR

=

Q3 – Q1

입니다.

즉 중앙 50% Data가 어느 정도 범위에 퍼져 있는지를 보여줍니다.

첨부 교재에서도 IQR을 25th와 75th Percentile 사이의 차이로 설명하며 Middle 50%의 Range로 연결합니다.

왜 Q1과 Q3 사이에 50%가 있을까?

Q1 아래:

약 25%

Q3 위:

약 25%

이므로:

100%

25%

25%

=

50%

입니다.

따라서:

Q1

Middle 50%

Q3

가 됩니다.

Percentile은 Distribution Shape도 보여줄 수 있을까?

여러 Percentile 사이의 간격을 비교하면 Distribution의 비대칭성을 이해하는 데 도움이 됩니다.

예를 들어:

Q1 = 40

Median = 50

Q3 = 60

이라면 중앙 부분이 비교적 균형적으로 보일 수 있습니다.

반면:

Q1 = 40

Median = 45

Q3 = 90

이라면 Upper Half가 훨씬 넓게 퍼져 있습니다.

즉 Percentile Spacing을 통해 Distribution Shape에 대한 힌트를 얻을 수 있습니다.

Median이 Q1보다 Q3에 훨씬 가까우면 무엇을 의미할까?

예를 들어:

Q1 = 10

Median = 80

Q3 = 90

이라면 Lower Half의 Spread가 더 넓을 수 있습니다.

반대로:

Q1 = 10

Median = 20

Q3 = 90

이라면 Upper Half가 더 넓게 퍼져 있을 수 있습니다.

다만 Quartile만으로 Distribution Shape를 완전히 결정할 수는 없습니다.

Histogram이나 Box Plot을 함께 확인하는 것이 좋습니다.

Quartile과 Box Plot의 관계

Box Plot은 Quartile을 시각적으로 표현하는 대표적인 Graph입니다.

일반적으로 Box는:

Q1

Median

Q3

를 보여줍니다.

즉 Box의 내부에는 Distribution의 중앙 50%가 표현됩니다.

따라서 Box Plot을 이해하려면 Quartile과 IQR 개념이 필수입니다.

Box가 길면 무엇을 의미할까?

Q1과 Q3 사이 거리가 크다는 의미입니다.

즉:

IQR가 큼

Middle 50%의 Spread가 큼

입니다.

반대로 Box가 짧으면 중앙 Observation들이 좁은 범위에 모여 있다는 의미일 수 있습니다.

Median Line이 Box 중앙에 없으면?

Distribution의 중앙 부분이 비대칭적일 가능성을 생각할 수 있습니다.

예를 들어 Median이 Q1 쪽에 가까우면 Q2~Q3 구간이 더 넓습니다.

이는 Upper Half의 Spread가 더 클 수 있다는 신호입니다.

하지만 전체 Tail까지 판단하려면 Whisker와 Outlier Point도 확인해야 합니다.

Percentile은 Skewed Data에서 왜 유용할까?

Skewed Distribution에서는 Mean과 Standard Deviation이 Extreme Tail의 영향을 많이 받을 수 있습니다.

반면 Percentile 기반 Statistic은 순위 정보를 사용하므로 더 Robust할 수 있습니다.

예를 들어 Income Data에서는 다음을 제시할 수 있습니다.

  • Median Income
  • 25th Percentile
  • 75th Percentile
  • 90th Percentile

이렇게 하면 전체 Income Distribution을 여러 위치에서 이해할 수 있습니다.

90th Percentile은 왜 자주 사용될까?

Distribution의 Upper Tail을 나타내는 기준으로 활용할 수 있기 때문입니다.

예를 들어 Response Time에서:

90th Percentile = 2.5 seconds

라면 Observation의 대부분이 대략 2.5초 이하의 범위에 있고 상위 Tail 일부가 그보다 큰 값을 갖는 구조를 이해할 수 있습니다.

서비스 성능, 소득, 대기시간처럼 Tail이 중요한 Data에서 Percentile이 유용합니다.

95th Percentile은 무엇을 의미할까?

같은 원리입니다.

95th Percentile은 Distribution에서 약 95%의 Observation이 그 값 이하에 위치하는 지점으로 해석할 수 있습니다.

예를 들어:

95th Percentile Response Time = 4 seconds

라면 대다수의 Request가 4초 이하에 완료되는 구조를 의미할 수 있습니다.

다만 실제 Sample Percentile의 정확한 계산은 Method에 따라 차이가 있을 수 있습니다.

99th Percentile은 왜 평균과 다른 정보를 줄까?

평균은 전체 Observation을 하나의 Arithmetic Center로 요약합니다.

하지만 99th Percentile은 극단적인 Upper Tail의 위치를 보여줍니다.

예를 들어 System Response Time이:

Mean = 0.5 sec

99th Percentile = 10 sec

라면 평균적인 성능은 좋아 보이지만 일부 User가 매우 느린 Response를 경험하고 있을 수 있습니다.

즉 Tail Performance는 Mean으로 잘 드러나지 않을 수 있습니다.

Percentile은 의료나 임상 Data에서도 사용할 수 있을까?

가능합니다.

예를 들어:

  • Height
  • Weight
  • Laboratory Value
  • Age
  • Duration

등의 Distribution을 Percentile로 설명할 수 있습니다.

다만 Reference Population과 Measurement Definition이 명확해야 합니다.

특정 환자가 90th Percentile이라는 의미도 어떤 Reference Population을 기준으로 계산했는지에 따라 달라집니다.

Reference Population이 왜 중요할까?

같은 Height 170cm라도:

성인 남성 Population

성인 여성 Population

10대 Population

에서 Percentile Rank가 달라질 수 있습니다.

따라서 Percentile은 절대적인 속성이 아니라 비교 대상 Distribution에 의존합니다.

Percentile을 해석할 때는 “몇 번째 Percentile인가?”만큼 “어떤 Population에서 계산한 Percentile인가?”도 중요합니다.

Sample Percentile과 Population Percentile은 같은 것일까?

구분할 수 있습니다.

Population 전체의 Distribution에서 정의되는 Percentile은 Population Characteristic입니다.

하지만 실제 연구에서는 Sample Data를 이용해 Sample Percentile을 계산하고 Population Percentile을 추정하는 경우가 많습니다.

즉:

Population

Unknown Percentiles

Sample

Sample Percentiles

Population Distribution 추정

이라는 구조로 이해할 수 있습니다.

Sample Size가 Percentile에 영향을 줄까?

그렇습니다.

작은 Sample에서는 Percentile Estimate가 몇 개 Observation에 크게 좌우될 수 있습니다.

특히:

95th

99th

같은 Extreme Percentile은 충분한 Sample Size가 없으면 불안정할 수 있습니다.

예를 들어 Observation이 20개뿐인데 99th Percentile을 정밀하게 해석하려고 하면 제한적일 수 있습니다.

Extreme Percentile일수록 왜 더 많은 Data가 필요할까?

99th Percentile은 Distribution의 매우 끝부분을 추정하려는 것입니다.

Sample이 작으면 해당 Tail에 Observation이 거의 없을 수 있습니다.

예를 들어 n=100이면 99th Percentile 부근은 극소수 Observation에 의해 결정될 수 있습니다.

따라서 Tail Percentile Estimate의 Precision은 Sample Size와 밀접하게 연결됩니다.

Percentile 계산법은 하나뿐일까?

아닙니다.

Sample Percentile을 계산하는 Algorithm에는 여러 Definition이 존재할 수 있습니다.

특히 Percentile 위치가 두 Observation 사이에 있을 때 어떤 Interpolation Rule을 사용하는지에 따라 결과가 약간 달라질 수 있습니다.

따라서 작은 Dataset에서는 Excel, SAS, 다른 Statistical Software 사이에서 Quartile 값이 다르게 보일 수도 있습니다.

그러면 어느 계산이 맞는 것일까?

하나의 방법만 절대적으로 맞고 나머지는 틀렸다고 단순하게 말하기 어렵습니다.

중요한 것은:

  • 사용한 Software
  • Percentile Definition
  • Analysis Method

를 일관되게 사용하는 것입니다.

특히 공식 분석이나 반복 Reporting에서는 같은 방법을 유지해야 비교 가능성이 높아집니다.

손으로 계산한 Q1과 SAS의 Q1이 다르면 오류일까?

반드시 그렇지 않습니다.

Quartile Calculation Method가 다를 수 있기 때문입니다.

예를 들어 한 방법에서는 Median을 포함해서 Lower Half를 나누고 다른 방법에서는 다른 Interpolation Rule을 사용할 수 있습니다.

따라서 차이가 발생하면 먼저 Software가 사용하는 Percentile Definition을 확인해야 합니다.

Percentile은 순위와 같은 것일까?

비슷하지만 동일하게 사용하면 안 됩니다.

Rank는 Observation의 순서 번호 자체를 나타낼 수 있습니다.

Percentile은 그 Rank를 전체 Distribution과 연결하여 상대적인 위치로 표현합니다.

예를 들어 1,000명 중 100등이라고 하면 Rank 정보입니다.

이를 Population Size와 연결하면 높은 Percentile 위치와 연결할 수 있습니다.

Percentile이 높을수록 항상 좋은 것일까?

아닙니다.

Variable의 의미에 따라 달라집니다.

예를 들어:

Test Score

높은 Percentile

좋은 성과일 수 있음

Blood Pressure

매우 높은 Percentile

건강 위험과 관련될 수 있음

Waiting Time

높은 Percentile

서비스 성능이 나쁠 수 있음

즉 Percentile은 위치만 알려주며 좋고 나쁨의 의미는 Variable Context가 결정합니다.

Scale Direction을 반드시 확인해야 하는 이유

예를 들어 Clinical Score가 높을수록 상태가 나쁜 Scale이라고 가정해보겠습니다.

90th Percentile Patient는 높은 Score Group에 있지만 이것이 좋은 상태라는 뜻은 아닙니다.

반대로 Higher Score = Better Scale에서는 높은 Percentile이 좋은 Outcome을 의미할 수 있습니다.

따라서 Percentile Interpretation에는 Variable Direction이 필요합니다.

Change Score의 Percentile도 계산할 수 있을까?

가능합니다.

예를 들어 Change from Baseline Distribution에서:

25th Percentile = -10

Median = -5

75th Percentile = 2

라면 Individual Change의 Distribution을 이해할 수 있습니다.

특히 Mean만으로는 Patient별 Heterogeneity를 충분히 설명하지 못할 때 Percentile이 도움이 될 수 있습니다.

Percentile과 Z-score는 같은 것일까?

아닙니다.

Z-score는 Observation이 Mean에서 Standard Deviation 단위로 얼마나 떨어져 있는지를 나타냅니다.

Percentile은 Distribution에서의 상대적 Rank Position을 나타냅니다.

Normal Distribution에서는 Z-score와 Percentile 사이에 일정한 관계를 만들 수 있지만 개념 자체는 다릅니다.

Normal Distribution의 50th Percentile은 무엇일까?

Symmetric Normal Distribution에서는:

Mean

=

Median

=

Mode

가 중심에 위치합니다.

따라서 50th Percentile도 Mean과 같은 위치에 있습니다.

하지만 Skewed Distribution에서는 Mean과 50th Percentile이 다를 수 있습니다.

Normal Distribution에서 Q1과 Q3는 대칭적일까?

Normal Distribution은 Mean을 중심으로 Symmetric하기 때문에 Q1과 Q3는 Median을 기준으로 대칭적인 위치에 있습니다.

따라서 Median에서 Q1까지 거리와 Median에서 Q3까지 거리가 같습니다.

실제 Sample에서는 Sampling Variability 때문에 완전히 동일하지 않을 수 있습니다.

Skewed Distribution에서는 Quartile 간격이 달라질 수 있다

예를 들어 Right-Skewed Data에서:

Q1 = 10

Median = 15

Q3 = 40

이라면:

Q1 → Median

차이 = 5

Median → Q3

차이 = 25

입니다.

이 구조는 Upper Portion이 훨씬 넓게 퍼져 있음을 나타냅니다.

따라서 Quartile은 Skewness를 이해하는 데도 도움이 됩니다.

Percentile과 Min·Max를 함께 보면 좋은 이유

Quartile은 중앙 Distribution을 보여주지만 Tail 전체를 설명하지 않습니다.

예를 들어:

Minimum = 1

Q1 = 48

Median = 50

Q3 = 52

Maximum = 1000

이라면 중앙 50%는 매우 좁게 모여 있지만 Tail에는 큰 Extreme Value가 존재합니다.

따라서:

Min / Max

Q1 / Median / Q3

를 함께 보면 Distribution의 전체 구조를 더 잘 이해할 수 있습니다.

Five-Number Summary란 무엇인가?

대표적으로 다음 다섯 값을 사용합니다.

  • Minimum
  • Q1
  • Median
  • Q3
  • Maximum

이 다섯 값만으로도 Distribution의 위치와 Spread를 상당 부분 파악할 수 있습니다.

구조는:

Minimum

Q1

Median

Q3

Maximum

입니다.

Five-Number Summary의 장점

Mean과 Standard Deviation 없이도:

  • 전체 Range
  • 중앙 위치
  • 중앙 50% Spread
  • Tail 비대칭

을 확인할 수 있습니다.

특히 Skewed Data에서 유용합니다.

또 Box Plot의 기본적인 해석과도 직접 연결됩니다.

Q1과 Q3는 Outlier를 찾는 데도 사용된다

앞선 글에서 설명했듯:

IQR = Q3 – Q1

을 계산한 뒤:

Lower Fence

=

Q1 – 1.5×IQR

Upper Fence

=

Q3 + 1.5×IQR

같은 기준으로 Potential Outlier를 탐색할 수 있습니다.

즉 Quartile은 단순히 Data를 네 부분으로 나누는 데서 끝나지 않습니다.

Outlier Detection과 Robust Statistics에도 연결됩니다.

Percentile이 Data Validation에도 도움이 될까?

가능합니다.

예를 들어 Laboratory Value의:

1st Percentile

Median

99th Percentile

을 확인하면 대부분 Data의 실제 범위를 빠르게 파악할 수 있습니다.

갑자기 99th Percentile이 이전 Dataset보다 매우 커졌다면:

  • New Extreme Values
  • Unit Change
  • Coding Error
  • Population Change

등을 확인할 수 있습니다.

여러 Dataset의 Percentile을 비교하면 무엇을 알 수 있을까?

Mean만 비교하는 것보다 Distribution 전체의 차이를 더 잘 이해할 수 있습니다.

예를 들어:

Group A

Q1 = 40

Median = 50

Q3 = 60

Group B

Q1 = 20

Median = 50

Q3 = 90

Median은 같습니다.

하지만 Group B의 Distribution이 훨씬 넓습니다.

Center는 같지만 Spread는 다릅니다.

두 Group의 Median과 IQR이 같으면 Distribution도 같은가?

아닙니다.

Median과 IQR이 같더라도 Tail이나 Shape가 다를 수 있습니다.

예를 들어 한 Group에는 Extreme Outlier가 있고 다른 Group에는 없을 수 있습니다.

따라서 Summary Statistic 몇 개가 같다고 Distribution 전체가 같다고 단정할 수 없습니다.

Histogram과 Box Plot을 함께 보는 이유입니다.

Percentile Curve를 사용하면 Distribution을 더 많이 볼 수 있을까?

여러 Percentile을 연속적으로 비교하면 Distribution의 Shape를 더 자세히 이해할 수 있습니다.

예를 들어:

10th

25th

50th

75th

90th

Percentile을 함께 제시할 수 있습니다.

이렇게 하면 Lower Tail, Center, Upper Tail을 모두 비교할 수 있습니다.

Decile은 무엇일까?

Quartile이 Data를 네 부분으로 나누는 것처럼 Decile은 Data를 열 부분으로 나누는 기준입니다.

예:

10th Percentile

20th Percentile

90th Percentile

입니다.

따라서 Quartile과 Decile은 모두 Percentile 개념의 응용입니다.

다만 첨부 교재에서는 Quartile을 핵심으로 설명하고 있습니다.

Percentile과 Quartile은 Statistical Model에 직접 사용될까?

ANOVA나 Regression처럼 Mean-based Model의 핵심 Parameter로 직접 사용되는 경우는 제한적일 수 있습니다.

하지만 Descriptive Statistics, Robust Analysis, Distribution Assessment에서는 매우 중요합니다.

또 Quantile Regression처럼 특정 Conditional Quantile을 Modeling하는 확장된 방법도 존재하지만 첨부 교재의 범위에서는 다루지 않습니다.

이 글에서는 Data Distribution을 이해하기 위한 Descriptive Statistic에 초점을 맞추는 것이 적절합니다.

SAS Enterprise Guide에서는 Quartile을 확인할 수 있을까?

가능합니다.

Summary Statistics Task에서 Percentile Statistics를 선택하여 다음과 같은 값을 확인할 수 있습니다.

  • First Quartile
  • Median
  • Third Quartile

앞선 교재 실습에서도 이러한 값을 이용해 Data Distribution과 IQR을 해석합니다.

즉 SAS Enterprise Guide에서 Mean과 Standard Deviation뿐 아니라 Rank-based Summary도 함께 확인할 수 있습니다.

Mean과 Quartile 중 무엇을 먼저 봐야 할까?

하나만 선택할 필요는 없습니다.

분석 초기에 다음을 함께 보면 좋습니다.

Mean

Arithmetic Center

Median

Positional Center

Q1 / Q3

Central Spread

Min / Max

Total Observed Boundary

이를 통해 Distribution이 대칭적인지 Skewed되어 있는지에 대한 힌트를 얻을 수 있습니다.

Mean과 Median이 비슷하고 Quartile도 대칭적이면?

비교적 Symmetric Distribution일 가능성을 생각할 수 있습니다.

예:

Q1 = 40

Median = 50

Q3 = 60

Mean = 50

하지만 이것만으로 Normal Distribution이라고 결론내리면 안 됩니다.

Histogram이나 Normality 관련 Plot을 추가로 확인해야 합니다.

Mean과 Median이 크게 다르고 Quartile도 비대칭적이면?

Skewed Distribution 가능성이 높아집니다.

예:

Q1 = 10

Median = 20

Q3 = 70

Mean = 55

같은 구조라면 Upper Tail이 길 수 있습니다.

이 경우 Median과 IQR이 Center와 Spread를 설명하는 데 더 적절할 수 있습니다.

Percentile을 보고 Outlier를 삭제해도 될까?

아닙니다.

예를 들어 99th Percentile보다 높은 Observation이라고 해서 자동으로 Outlier Error가 아닙니다.

Percentile은 위치를 나타낼 뿐입니다.

Population의 상위 1%에 실제로 매우 큰 값이 존재할 수도 있습니다.

따라서 Extreme Percentile에 위치한 Observation은 필요하면 Source와 Context를 확인해야 합니다.

99th Percentile 위의 값은 항상 1%일까?

Population Distribution에서 개념적으로는 약 1%가 99th Percentile보다 높은 영역에 위치합니다.

하지만 Sample Data에서는 Ties, Percentile Calculation Method, Sample Size 등에 따라 정확한 Count가 단순히 n×1%와 일치하지 않을 수 있습니다.

따라서 Sample Percentile을 지나치게 기계적으로 해석하면 안 됩니다.

Tied Value가 많으면 Percentile 해석은 어떻게 될까?

예를 들어 Score가 정수이고 많은 사람이 동일한 Score를 받으면 동일한 값에 여러 Observation이 몰릴 수 있습니다.

이 경우 특정 Percentile Boundary에 많은 Observation이 겹칠 수 있습니다.

따라서 “정확히 25%가 Q1보다 작다”라고 표현하기보다 약 25%가 그 값 이하에 위치하는 기준으로 이해하는 것이 안전합니다.

Ordinal Variable에서도 Percentile을 사용할 수 있을까?

가능합니다.

Ordinal Variable에는 순서가 존재하기 때문입니다.

예를 들어 Severity:

Mild

Moderate

Severe

에 대한 Median Category나 Percentile Position을 생각할 수 있습니다.

다만 Category 사이 Equal Distance가 보장되는 것은 아닙니다.

따라서 Percentile은 순서를 이용하지만 Arithmetic Distance를 요구하지 않는다는 점에서 Ordinal Data와 잘 연결될 수 있습니다.

Nominal Variable에서는 Percentile이 의미 있을까?

일반적으로 적절하지 않습니다.

예를 들어 Region:

Korea

USA

Japan

에는 자연스러운 Order가 없습니다.

따라서:

25th Percentile Region

이라는 개념을 정의하기 어렵습니다.

Nominal Variable에서는 Frequency와 Percentage가 더 적절합니다.

Percentile을 계산하려면 Data를 정렬할 수 있어야 하는 이유

Percentile은 위치 개념이기 때문입니다.

따라서 Variable에 최소한 자연스러운 Order가 있어야 합니다.

이 때문에:

Ordinal

가능

Interval / Ratio

가능

반면:

Nominal

일반적으로 부적절

입니다.

Percentile과 Measurement Scale의 관계

다음처럼 정리할 수 있습니다.

Nominal

Order 없음

Percentile 부적절

Ordinal

Order 있음

Percentile 가능

Interval / Ratio

Order + Meaningful Distance

Percentile 가능

즉 Percentile은 Mean보다 더 낮은 Measurement Requirement를 가집니다.

Mean은 Distance Information이 필요하지만 Percentile은 기본적으로 Rank Information을 이용하기 때문입니다.

Percentile이 Mean보다 Robust한 이유를 다시 정리하면

Mean은 각 Observation의 실제 크기를 모두 이용합니다.

반면 Percentile은 Observation의 상대적인 순서를 중심으로 합니다.

따라서 1,000이라는 Extreme Value가 1,000,000으로 더 커져도 다른 Observation의 Rank가 바뀌지 않는다면 Median이나 Quartile은 거의 변하지 않을 수 있습니다.

이것이 Rank-based Statistic의 Robustness입니다.

Percentile은 Data Transformation에 어떻게 반응할까?

값의 순서를 유지하는 Monotonic Transformation을 적용하면 Observation의 Rank Order는 유지됩니다.

예를 들어 모든 값에 일정한 양수를 더하는 경우 Percentile Order는 그대로 유지됩니다.

하지만 Percentile의 실제 값 자체는 Transformation에 따라 변합니다.

Rank Structure와 Numerical Scale을 구분해야 합니다.

Group별 Percentile은 언제 유용할까?

예를 들어 Treatment Group별 Outcome Distribution을 비교할 때:

  • Q1
  • Median
  • Q3
  • 90th Percentile

을 비교할 수 있습니다.

이는 단순 Group Mean 차이보다 Distribution의 어느 영역에서 차이가 나타나는지 탐색하는 데 도움이 됩니다.

다만 Formal Group Comparison에는 Research Question에 맞는 Statistical Model이 별도로 필요할 수 있습니다.

Mean Difference가 없어도 Percentile Difference가 있을 수 있을까?

가능합니다.

예를 들어 두 Group의 Mean은 같지만 Distribution Shape가 다를 수 있습니다.

Group A는 좁게 모여 있고 Group B는 양쪽 Tail이 넓을 수 있습니다.

이 경우 Median이나 특정 Percentile에서 차이가 나타날 수 있습니다.

따라서 Mean만 비교하면 Distribution의 다른 차이를 놓칠 수 있습니다.

Percentile을 이용한 Reporting의 장점

다음과 같은 정보를 한 번에 보여줄 수 있습니다.

25th Percentile

Lower Distribution

Median

Center

75th Percentile

Upper Distribution

90th / 95th Percentile

Upper Tail

이렇게 다양한 위치를 제시하면 Data Distribution을 보다 풍부하게 설명할 수 있습니다.

하지만 Percentile을 너무 많이 제시하면?

정보가 지나치게 많아질 수 있습니다.

연구 목적에 따라 필요한 Percentile을 선택하는 것이 좋습니다.

일반적인 Descriptive Summary에서는:

  • Q1
  • Median
  • Q3

가 매우 유용합니다.

Tail이 중요한 분석에서는 90th, 95th, 99th Percentile 등을 추가할 수 있습니다.

SAS Output에서 Quartile을 확인한 뒤 무엇을 해야 할까?

다음 순서로 연결하면 좋습니다.

Q1 / Median / Q3 확인

IQR 계산

Min / Max 비교

Box Plot 확인

Histogram 확인

Skewness / Extreme Value 해석

즉 Quartile은 단독 Statistic이 아니라 전체 Distribution Review의 일부입니다.

Percentile과 Quartile의 전체 구조

지금까지 내용을 한 번에 정리하면 다음과 같습니다.

Data 정렬

상대적 위치 계산

Percentile

대표적 기준

25th Percentile

Q1

50th Percentile

Median / Q2

75th Percentile

Q3

그리고:

Q3 – Q1

IQR

Middle 50% Spread

입니다.

첨부 교재에서도 Percentile을 Data의 상대적인 위치를 나타내는 개념으로 설명하고 25th, 50th, 75th Percentile을 각각 First Quartile, Median, Third Quartile로 구분합니다.

흔한 오해 정리

“90th Percentile은 90점이다”

아닙니다.

90th Percentile은 Distribution에서의 상대적 위치입니다.

“Percentile과 Percentage는 같은 개념이다”

아닙니다.

Percentage는 비율이고 Percentile은 위치입니다.

“50th Percentile은 Mean이다”

아닙니다.

50th Percentile은 Median입니다.

“Q1은 Minimum이다”

아닙니다.

Q1은 25th Percentile입니다.

“Q3는 Maximum이다”

아닙니다.

Q3는 75th Percentile입니다.

“Quartile은 Data를 세 부분으로 나눈다”

아닙니다.

세 개의 기준점 Q1, Q2, Q3가 Data를 네 구간으로 나눕니다.

“IQR은 Q3 – Median이다”

아닙니다.

IQR은 Q3 – Q1입니다.

“Percentile 값은 반드시 실제 Observation이어야 한다”

아닙니다.

계산 방식에 따라 두 Observation 사이의 값이 될 수 있습니다. 첨부 교재의 Percentile Example에서도 이러한 형태를 확인할 수 있습니다.

“Percentile이 높으면 항상 좋은 것이다”

아닙니다.

Variable의 방향과 의미에 따라 달라집니다.

“같은 값이면 어느 Population에서나 같은 Percentile이다”

아닙니다.

Percentile은 Reference Distribution에 따라 달라집니다.

“Software마다 Quartile 값이 다르면 하나가 틀린 것이다”

반드시 그렇지 않습니다.

Sample Percentile Definition과 Interpolation 방식이 다를 수 있습니다.

왜 Percentile과 Quartile을 이해해야 할까?

이후 Distribution을 분석할 때 다음 개념들과 직접 연결되기 때문입니다.

Percentile

Relative Position

Quartile

Distribution을 네 부분으로 구분

Median

50th Percentile

IQR

Q3 – Q1

Box Plot

Q1 / Median / Q3 시각화

Outlier Detection

IQR 활용 가능

Skewness

Quartile 간격과 Tail 구조 비교

즉 Percentile과 Quartile은 단순히 몇 번째 위치를 계산하는 Statistic이 아니라 Distribution의 구조를 읽는 언어입니다.

핵심 정리

Percentile은 정렬된 Data에서 특정 값이 전체 Distribution의 어느 상대적 위치에 있는지를 나타냅니다.

첨부 교재에서는 대표적으로 다음 세 Percentile을 강조합니다.

25th Percentile

First Quartile, Q1

50th Percentile

Median, Q2

75th Percentile

Third Quartile, Q3

이 세 지점을 이용하면 Data를 네 부분으로 나눌 수 있습니다.

전체 구조는:

Lowest 25%

Q1

25%

Median

25%

Q3

Highest 25%

입니다.

또한:

IQR = Q3 – Q1

을 통해 중앙 50% Data의 Spread를 측정할 수 있습니다.

Percentile과 Quartile은 Mean처럼 모든 Observation의 실제 크기를 직접 사용하는 Statistic보다 Extreme Value에 상대적으로 덜 민감하며, Skewed Distribution이나 Ordinal Data를 설명할 때 특히 유용할 수 있습니다. 첨부 교재에서도 Skewed Distribution이나 여러 Extreme Outlier가 존재하는 경우 IQR이 Dispersion을 나타내는 데 적절할 수 있다고 설명합니다.

Percentile은 값이 얼마나 큰지를 절대적으로 평가하는 것이 아니라, 전체 Distribution 안에서 그 값이 어디에 위치하는지를 보여줍니다.

따라서 Data를 이해할 때 Mean 하나만 보는 것보다 Q1, Median, Q3와 같은 Relative Position을 함께 확인하면 Distribution의 Center와 Spread, 비대칭성을 훨씬 더 정확하게 해석할 수 있습니다.

함께 읽으면 좋은 글

  • Mean·Median·Mode의 차이: 데이터 분포에 따라 중심값을 선택하는 기준
  • Variance와 Standard Deviation의 의미: 평균만으로 데이터 변동성을 설명할 수 없는 이유
  • Range와 Interquartile Range의 차이: 이상치 영향을 줄여 산포를 측정하는 방법
  • Distribution을 먼저 확인해야 하는 이유: 데이터의 위치·산포·형태를 점검하는 과정
  • Skewness와 Extreme Value의 영향: 비대칭 분포와 극단값이 통계량을 왜곡하는 방식

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Fundamental Statistical Concepts
  • Percentiles
  • Quartiles
  • Measures of Central Tendency
  • The Spread of a Distribution: Dispersion

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.