Range와 Interquartile Range의 차이: 이상치 영향을 줄여 산포를 측정하는 방법
데이터의 중심을 Mean이나 Median으로 설명했다면 다음으로 확인해야 할 것은 Data가 얼마나 넓게 퍼져 있는가입니다.
이를 나타내는 개념이 Dispersion, 즉 산포입니다.
산포를 측정하는 방법에는 여러 가지가 있지만 가장 직관적인 두 지표가 Range와 Interquartile Range, IQR입니다.
둘 다 Data의 Spread를 나타내지만 사용하는 Data 범위와 Extreme Value에 대한 민감도가 크게 다릅니다.
Range는 전체 Data에서 Maximum과 Minimum의 차이를 사용하고, Interquartile Range는 중앙 50% Data의 범위를 사용합니다.
따라서 Extreme Value가 존재하거나 Distribution이 Skewed된 경우에는 Range보다 IQR이 Data의 전형적인 Spread를 더 안정적으로 보여줄 수 있습니다.
첨부 교재에서도 Range를 Maximum과 Minimum의 차이로 정의하고, Interquartile Range를 25th Percentile과 75th Percentile 사이의 차이로 설명합니다. 또한 Skewed Distribution이나 여러 Extreme Outlier가 존재하는 경우 IQR이 Dispersion을 표현하는 데 더 적절할 수 있다고 설명합니다.
Range란 무엇인가?
Range는 가장 간단한 Dispersion Measure입니다.
계산 구조는 다음과 같습니다.
Maximum
Minimum
↓
Range
예를 들어 Data가:
10
20
30
40
50
이라면:
Maximum = 50
Minimum = 10
따라서:
Range = 50 – 10 = 40
입니다.
즉 Range는 Data 전체가 최소값에서 최대값까지 얼마나 넓게 퍼져 있는지를 보여줍니다.
Range의 가장 큰 장점은 무엇일까?
계산이 매우 쉽고 직관적입니다.
예를 들어:
“이 시험 점수는 40점에서 95점까지 분포했다.”
라고 말하면:
Range = 55
라는 정보를 바로 이해할 수 있습니다.
따라서 Data의 전체 범위를 빠르게 확인하는 데 매우 유용합니다.
특히 Data Quality Check에서는 Minimum과 Maximum을 확인하는 것만으로도 비정상적인 값을 발견할 수 있습니다.
Range는 Data Quality Check에 왜 유용할까?
예를 들어 Age Data에서:
Minimum = 18
Maximum = 85
라면 일반적인 Adult Study에서는 합리적일 수 있습니다.
하지만:
Minimum = -5
Maximum = 950
이라고 나온다면 Data Coding이나 Entry Error를 확인해야 합니다.
즉 Range는 단순한 산포 Statistic이면서 동시에 Extreme Value Detection의 첫 단계가 될 수 있습니다.
Range의 가장 큰 한계는 무엇일까?
Range는 전체 Data 중 단 두 개의 값만 사용합니다.
바로:
Minimum
Maximum
입니다.
중간에 있는 Observation들이 어떻게 분포하는지는 전혀 반영하지 않습니다.
예를 들어 다음 두 Dataset을 비교해보겠습니다.
Dataset A
0
49
50
51
100
Dataset B
0
1
2
3
100
두 Dataset 모두:
Minimum = 0
Maximum = 100
따라서 Range = 100입니다.
하지만 실제 Data Distribution은 전혀 다릅니다.
Dataset A는 대부분 50 근처에 모여 있고, Dataset B는 대부분 0~3 근처에 몰려 있습니다.
Range가 같다고 해서 Data의 실제 Spread Structure가 같다는 의미는 아닙니다.
Extreme Value 하나가 Range를 얼마나 바꿀 수 있을까?
다음 Data를 생각해보겠습니다.
10
11
12
13
14
Range는:
14 – 10 = 4
입니다.
그런데 마지막 값이 100으로 바뀌면:
10
11
12
13
100
Range는:
100 – 10 = 90
이 됩니다.
Observation 하나만 바뀌었는데 Range가 4에서 90으로 크게 증가했습니다.
이것이 Range가 Extreme Value에 매우 민감한 이유입니다.
Extreme Value가 실제 값이어도 Range는 크게 변할까?
그렇습니다.
Extreme Value가 Data Error가 아니라 실제 Observation이어도 Range는 크게 영향을 받습니다.
예를 들어 Income Data에서 대부분의 사람이:
3,000만~8,000만 원
사이에 있지만 한 명이:
100억 원
의 Income을 가진다면 전체 Range는 매우 커집니다.
하지만 이 Range가 대부분 사람들의 Income Spread를 잘 설명한다고 보기 어렵습니다.
이런 상황에서 IQR이 유용합니다.
Percentile이란 무엇인가?
Interquartile Range를 이해하려면 먼저 Percentile을 알아야 합니다.
Percentile은 Data에서 특정 비율이 그 값 이하에 위치하도록 하는 상대적 위치를 나타냅니다.
첨부 교재에서는 Percentile을 주어진 비율의 Data Value보다 큰 위치를 찾는 값으로 설명하며, 대표적으로 다음 Percentile을 제시합니다.
- 25th Percentile = First Quartile
- 50th Percentile = Median
- 75th Percentile = Third Quartile
즉 Percentile은 단순 수치가 아니라 Data에서 Observation의 상대적 위치를 표현합니다.
Quartile이란 무엇인가?
Quartile은 정렬된 Data를 네 부분으로 나누는 기준입니다.
대표적으로 다음 세 지점을 사용합니다.
Q1
First Quartile
↓
25th Percentile
Q2
Second Quartile
↓
50th Percentile
↓
Median
Q3
Third Quartile
↓
75th Percentile
첨부 교재에서도 Quartile이 Data를 네 부분으로 나눈다고 설명합니다.
Q1은 무엇을 의미할까?
Q1은 25th Percentile입니다.
즉 Data를 작은 값에서 큰 값으로 정렬했을 때 대략 25%의 Data가 Q1 이하에 위치합니다.
예를 들어 Q1이 20이라면 Data의 약 25%가 20 이하에 위치하는 구조로 이해할 수 있습니다.
Q3는 무엇을 의미할까?
Q3는 75th Percentile입니다.
즉 Data의 약 75%가 Q3 이하에 위치하고, 나머지 약 25%가 그보다 높은 영역에 위치합니다.
예를 들어:
Q3 = 80
이라면 Data의 대부분이 80 이하에 위치하는 구조입니다.
Interquartile Range란 무엇인가?
Interquartile Range, 줄여서 IQR은 Q3와 Q1의 차이입니다.
개념적으로:
Q3
Q1
↓
IQR
입니다.
즉:
75th Percentile
25th Percentile
으로 계산합니다.
첨부 교재에서는 IQR을 25th와 75th Percentile 사이의 차이라고 정의하고, Middle 50% of Data Values의 Range라고 설명합니다.
왜 IQR은 중앙 50%를 나타낼까?
Q1 아래에는 약 25%의 Data가 있습니다.
Q3 위에도 약 25%가 있습니다.
따라서 Q1과 Q3 사이에는:
100%
25%
25%
=
50%
의 Data가 위치합니다.
즉:
Lowest 25%
↓
Q1
↓
Middle 50%
↓
Q3
↓
Highest 25%
입니다.
따라서 IQR은 Distribution 가운데 절반의 Spread를 보여줍니다.
예를 들어 IQR을 계산해보자
다음과 같은 Quartile이 있다고 가정해보겠습니다.
Q1 = 20
Median = 40
Q3 = 70
이라면:
IQR = 70 – 20
=
50
입니다.
즉 Data의 중앙 50%가 20에서 70 사이에 위치한다고 해석할 수 있습니다.
첨부 교재의 SATScore 예에서는 어떻게 계산할까?
첨부 교재의 TESTSCORES Example에서는 다음 값이 제시됩니다.
- Minimum = 890
- Maximum = 1600
- Q1 = 1085
- Median = 1170
- Q3 = 1280
따라서:
Range
=
1600 – 890
=
710
그리고:
IQR
=
1280 – 1170
이라고 하면 안 됩니다.
여기서 중요한 점은 IQR은 Q3 – Q1이므로:
1280 – 1085
=
195
가 되어야 합니다.
다만 검색된 해당 교재 Output 설명에는 IQR을 1280 – 1170 = 110으로 기술한 부분이 확인됩니다. 이는 같은 페이지에서 제시된 정의인 Q3 - Q1과 일치하지 않습니다. 따라서 개념적으로는 IQR = Q3 – Q1이라는 정의를 기준으로 이해하는 것이 맞습니다.
교재의 BodyTemp Example에서는 IQR이 어떻게 계산될까?
첨부 교재의 NORMTEMP Example에서는:
Q1 = 97.80
Q3 = 98.70
으로 제시됩니다.
따라서:
IQR = 98.70 – 97.80
=
0.90
입니다.
교재에서도 동일하게 IQR을 0.90으로 계산합니다.
이 사례에서는 IQR의 정의와 계산이 일치합니다.
왜 IQR은 Extreme Value에 덜 민감할까?
IQR은 Minimum과 Maximum을 사용하지 않습니다.
오직:
Q1
과
Q3
사이의 중앙 50%만 사용합니다.
예를 들어:
10
11
12
13
14
에서 가장 큰 값을 1000으로 바꿔도 Q1과 Q3의 위치는 Range만큼 극단적으로 변하지 않을 수 있습니다.
즉:
Extreme Tail
↓
IQR 계산에 직접적인 영향 제한
입니다.
IQR은 Data의 Tail보다 중앙에 집중하기 때문에 Extreme Value에 Range보다 Robust합니다.
Robust하다는 것은 무엇을 의미할까?
Robust Statistic은 Outlier나 Extreme Value가 존재해도 값이 지나치게 크게 변하지 않는 Statistic을 의미합니다.
예를 들어:
Mean
Extreme Value 영향 큼
Median
Extreme Value 영향 상대적으로 작음
그리고:
Standard Deviation / Range
Extreme Value 영향 큼
IQR
Extreme Value 영향 상대적으로 작음
이라는 관계를 생각할 수 있습니다.
따라서 흔히:
Mean + Standard Deviation
과
Median + IQR
을 각각 하나의 Summary Pair로 생각할 수 있습니다.
Median과 IQR이 함께 사용되는 이유
Median은 Distribution의 중앙 위치를 나타냅니다.
IQR은 그 중앙 주변의 Spread를 나타냅니다.
둘 다 Extreme Value의 영향을 상대적으로 덜 받습니다.
따라서 Skewed Data에서는:
Median
↓
Center
IQR
↓
Spread
를 함께 사용하는 것이 자연스럽습니다.
첨부 교재도 Skewed Distribution이나 여러 Extreme Outlier가 존재하는 경우 IQR이 Dispersion을 설명하는 데 더 적절할 수 있다고 설명합니다.
Mean과 SD는 어떤 경우에 더 자연스러울까?
첨부 교재에서는 Variance와 Standard Deviation은 일반적으로 Central Tendency Measure로 Mean이 적절한 경우 함께 사용한다고 설명합니다.
즉 비교적 Symmetric한 Continuous Data에서는:
Mean
Standard Deviation
을 사용할 수 있습니다.
반면:
- Skewed Distribution
- 여러 Extreme Outlier
- Ordinal Variable
에서는:
Median
IQR
이 더 적절할 수 있습니다.
Range와 IQR의 가장 큰 차이
다음처럼 정리할 수 있습니다.
Range
전체 범위
↓
Maximum – Minimum
↓
Tail까지 모두 포함
↓
Extreme Value에 매우 민감
IQR
중앙 범위
↓
Q3 – Q1
↓
Middle 50%
↓
Extreme Value에 상대적으로 덜 민감
즉 Range는 전체 Data Boundary를 보여주고 IQR은 전형적인 중앙 Spread를 보여줍니다.
Range가 큰데 IQR은 작다면 무엇을 의미할까?
매우 중요한 패턴입니다.
예를 들어:
Range = 1,000
IQR = 20
이라고 가정해보겠습니다.
이 경우 대부분 Data는 좁은 범위에 몰려 있지만 일부 Extreme Value가 매우 멀리 떨어져 있을 가능성을 생각할 수 있습니다.
즉:
Large Range
Small IQR
↓
Extreme Tail / Outlier 가능
입니다.
이 경우 Box Plot을 확인하면 도움이 됩니다.
Range와 IQR이 둘 다 크면?
Data 전체뿐 아니라 중앙 50% 자체도 넓게 퍼져 있을 가능성이 있습니다.
즉 Extreme Value 하나 때문에 Spread가 커진 것이 아니라 Distribution 전반의 Variability가 클 수 있습니다.
하지만 정확한 판단을 위해 Histogram과 Box Plot을 함께 보는 것이 좋습니다.
Range는 매우 작고 IQR도 작다면?
Data가 좁은 범위에 밀집되어 있을 가능성이 있습니다.
예를 들어 Measurement가 매우 일정하거나 Population Variability가 작을 수 있습니다.
하지만 지나친 값 반복이나 Measurement Rounding이 있는지도 확인할 수 있습니다.
IQR이 0일 수도 있을까?
가능합니다.
예를 들어 많은 Observation이 동일한 값에 몰려 Q1과 Q3가 같다면:
IQR = Q3 – Q1 = 0
이 될 수 있습니다.
이는 중앙 50% Data가 같은 값 또는 매우 제한된 범위에 집중되어 있음을 의미할 수 있습니다.
Range가 0이면 무엇을 의미할까?
Minimum과 Maximum이 같다는 뜻입니다.
따라서 모든 Observation이 같은 값을 가진다는 의미입니다.
예:
50
50
50
50
이라면:
Range = 0
IQR = 0
Standard Deviation = 0
입니다.
즉 Data Variation이 없습니다.
IQR을 Ordinal Variable에서도 사용할 수 있는 이유
Ordinal Variable에는 Category 사이에 순서가 있습니다.
따라서:
25th Percentile
Median
75th Percentile
같은 Rank-based Position을 정의할 수 있습니다.
반면 Category 간 실제 Distance가 동일하다고 보장되지 않기 때문에 Mean이나 SD보다 Median과 IQR이 Scale 특성을 더 잘 반영할 수 있는 경우가 있습니다.
첨부 교재도 Ordinal Variable의 Dispersion에서는 IQR이 더 적절할 수 있다고 설명합니다.
Nominal Variable에서도 IQR을 사용할 수 있을까?
일반적으로 적절하지 않습니다.
Nominal Variable에는 자연스러운 Order가 없기 때문입니다.
예를 들어 Blood Type:
A
B
AB
O
에는:
25th Percentile
75th Percentile
이라는 순위 개념을 자연스럽게 정의하기 어렵습니다.
Nominal Data에서는 Frequency와 Percentage가 더 적절합니다.
Percentile 계산 방식은 Software마다 완전히 같을까?
주의할 필요가 있습니다.
Percentile은 Sample Data에서 계산할 때 여러 정의와 Interpolation Method가 존재할 수 있습니다.
따라서 Dataset이 작거나 특정 위치에서 값이 애매할 경우 Software나 설정에 따라 Quartile 값이 약간 달라질 수 있습니다.
중요한 것은 IQR의 기본 원리는:
Q3 – Q1
이라는 점입니다.
실제 보고에서는 사용한 Statistical Software와 Method가 일관되어야 합니다.
Quartile을 직접 눈으로 계산하는 것과 SAS 결과가 다를 수도 있을까?
가능합니다.
Data가 적을 때 Quartile 정의에 따라 사람이 손으로 계산한 값과 Software가 사용하는 Percentile Algorithm이 다를 수 있습니다.
따라서 실제 SAS 결과를 보고할 때는 임의로 다른 Quartile 방식으로 다시 계산하기보다 사용한 Procedure의 정의와 Output을 일관되게 사용하는 것이 좋습니다.
Box Plot과 IQR은 어떻게 연결될까?
Box Plot의 핵심 구조가 바로 Quartile과 IQR입니다.
일반적으로 Box는:
Q1
↓
Median
↓
Q3
범위를 보여줍니다.
따라서 Box 자체의 길이가 IQR과 연결됩니다.
개념적으로:
Q1 ├──── Median ────┤ Q3
↓
Box Width/Height
↓
IQR
입니다.
Box Plot의 Whisker는 Minimum과 Maximum일까?
항상 그렇다고 생각하면 안 됩니다.
일반적인 Box Plot에서는 Whisker가 특정 IQR 기준 안의 가장 먼 Observation까지 표시되고 그 밖의 Observation을 Potential Outlier로 따로 표시하는 방식이 흔합니다.
따라서 Box Plot의 끝이 실제 Minimum과 Maximum과 반드시 동일한 것은 아닐 수 있습니다.
사용한 Software와 Plot Definition을 확인해야 합니다.
1.5×IQR Rule이란 무엇인가?
Outlier 탐색에서 자주 사용하는 규칙입니다.
먼저:
IQR = Q3 – Q1
을 계산합니다.
그 다음:
Lower Fence
=
Q1 – 1.5 × IQR
Upper Fence
=
Q3 + 1.5 × IQR
을 계산합니다.
이 범위를 벗어난 Observation을 Potential Outlier로 표시할 수 있습니다.
1.5×IQR 밖이면 무조건 Data Error일까?
아닙니다.
이 규칙은 Outlier를 탐색하는 기준이지 Data Error를 판정하는 규칙이 아닙니다.
예를 들어 매우 큰 Income이나 매우 긴 Hospital Stay가 실제 Observation일 수 있습니다.
따라서:
Outlier Flag
↓
확인 필요
이지:
Outlier Flag
↓
자동 삭제
가 아닙니다.
IQR은 Outlier 자체를 제거한 Statistic일까?
정확히는 그렇지 않습니다.
IQR 계산 시 Tail 25%와 25%의 실제 범위를 직접 사용하지 않기 때문에 Extreme Value 영향이 줄어드는 것입니다.
하지만 Data를 물리적으로 삭제한 것은 아닙니다.
즉:
Robust Summary
와
Data Exclusion
을 구분해야 합니다.
Range는 Outlier Detection에서 쓸모가 없을까?
그렇지 않습니다.
Range는 오히려 Data Quality Check에서 매우 중요합니다.
예를 들어 Expected Score Range가:
0~100
인데 Maximum이 900이면 바로 문제를 발견할 수 있습니다.
따라서 Range와 IQR은 경쟁 관계라기보다 서로 다른 목적을 가집니다.
Range
전체 Boundary 확인
IQR
중앙 Spread 확인
입니다.
Min·Max와 Q1·Q3를 함께 보면 무엇이 좋을까?
다음 네 값을 같이 보면 Distribution의 기본 구조를 빠르게 파악할 수 있습니다.
- Minimum
- Q1
- Q3
- Maximum
예를 들어:
Minimum = 5
Q1 = 48
Q3 = 52
Maximum = 500
이라면 대부분 Data는 48~52 근처인데 Tail에 매우 큰 값이 존재함을 쉽게 알 수 있습니다.
Median까지 추가하면?
Five-number Summary 구조가 됩니다.
대표적으로:
- Minimum
- Q1
- Median
- Q3
- Maximum
을 사용할 수 있습니다.
이 값들은 Distribution의 위치와 Spread를 간단하게 보여줍니다.
Box Plot도 이와 밀접하게 연결됩니다.
Five-number Summary의 장점
Mean과 SD만 볼 때보다 Distribution의 비대칭성을 이해하기 쉽습니다.
예를 들어:
Minimum = 10
Q1 = 20
Median = 30
Q3 = 40
Maximum = 200
이라면 Maximum 쪽 Tail이 매우 길다는 것을 쉽게 알 수 있습니다.
즉 Right Skew 가능성을 생각할 수 있습니다.
Q1과 Median 사이, Median과 Q3 사이가 다르면?
Distribution의 중앙 부분에서도 비대칭성이 있을 수 있습니다.
예를 들어:
Q1 = 10
Median = 20
Q3 = 80
이라면 Median에서 Q3까지의 간격이 훨씬 큽니다.
이런 구조는 Distribution의 Upper Half가 더 넓게 퍼져 있음을 나타낼 수 있습니다.
따라서 IQR 총값뿐 아니라 Quartile 위치 자체도 유용합니다.
Range와 IQR을 함께 보고 Skewness를 알 수 있을까?
힌트를 얻을 수 있지만 완전히 판단하기에는 부족합니다.
예를 들어 Upper Tail이 매우 길면 Maximum과 Q3 사이의 거리도 커질 수 있습니다.
하지만 정확한 Distribution Shape를 이해하려면:
- Histogram
- Box Plot
- Skewness Statistic
을 함께 확인하는 것이 좋습니다.
Standard Deviation과 IQR 중 무엇을 선택해야 할까?
Data Distribution과 Measurement Scale에 따라 달라집니다.
대칭적인 Continuous Data
Mean
SD
Skewed Continuous Data
Median
IQR
Ordinal Data
Median
IQR
을 고려할 수 있습니다.
첨부 교재에서도 이러한 기준을 설명합니다.
왜 Skewed Data에서 SD보다 IQR이 유용할까?
Standard Deviation은 Mean을 기준으로 모든 Squared Deviation을 사용합니다.
따라서 Extreme Tail이 큰 영향을 줍니다.
반면 IQR은 중앙 50%만 사용합니다.
따라서 Skewed Tail이나 Extreme Value 때문에 Spread Statistic이 지나치게 커지는 문제를 줄일 수 있습니다.
그렇다면 Skewed Data에서는 Range를 보고하지 말아야 할까?
그렇게 단정할 필요는 없습니다.
Range는 전체 Observed Data Boundary를 보여주기 때문에 여전히 유용할 수 있습니다.
예를 들어 Reporting에서:
Median [Q1, Q3]
Min–Max
를 함께 제시할 수 있습니다.
즉:
Typical Spread
↓
IQR
그리고:
Total Observed Spread
↓
Range
를 동시에 보여줄 수 있습니다.
Range가 Sample Size에 영향을 받을까?
그렇습니다.
Sample Size가 커질수록 더 극단적인 Observation을 포함할 가능성도 커질 수 있습니다.
따라서 같은 Population에서 Sample Size가 큰 Dataset은 작은 Dataset보다 Range가 커질 가능성이 있습니다.
이 때문에 서로 다른 Sample Size의 Group에서 Range만 직접 비교할 때는 주의해야 합니다.
IQR도 Sample Size 영향을 받을까?
Sample Statistic이므로 Sample에 따라 달라질 수 있습니다.
하지만 Minimum과 Maximum처럼 극단적인 Observation에 직접 의존하지 않기 때문에 Range보다는 Sample Size와 Extreme Tail에 덜 민감한 경우가 많습니다.
그래도 작은 Sample에서는 Quartile Estimate 자체가 불안정할 수 있습니다.
작은 Sample에서 IQR을 해석할 때 주의할 점
Observation 수가 매우 적으면 Q1과 Q3가 몇 개 Observation의 위치에 크게 의존할 수 있습니다.
또 Percentile 계산법에 따라 값이 달라질 수 있습니다.
따라서 작은 Sample에서는:
- Raw Data
- Dot Plot
- Individual Value
를 함께 보는 것이 도움이 될 수 있습니다.
Range가 Group Variability 비교에 적합할까?
단순하게 Range만 비교하는 것은 제한적입니다.
예를 들어:
Group A n = 20
Group B n = 1,000
이라면 Group B에서 더 Extreme한 값이 관찰될 가능성이 높습니다.
따라서 Group Spread를 비교할 때는:
- SD
- IQR
- Box Plot
등을 함께 사용하는 것이 좋습니다.
IQR은 Group Comparison에서 유용할까?
그렇습니다.
예를 들어 두 Treatment Group의 Median과 IQR을 비교하면 각 Group의 Typical Center와 Middle 50% Spread를 함께 확인할 수 있습니다.
Treatment A
Median = 20
IQR = 5
Treatment B
Median = 20
IQR = 30
Median은 같지만 Treatment B의 Individual Variability가 훨씬 클 수 있습니다.
Median이 같아도 IQR이 다르면 중요한 이유
두 Group의 Typical Center는 비슷하지만 Data의 일관성이 다를 수 있습니다.
예를 들어 어떤 Treatment에서는 대부분 Patient가 비슷한 Response를 보이고, 다른 Treatment에서는 Response가 매우 다양할 수 있습니다.
Mean이나 Median만으로는 이런 차이를 확인할 수 없습니다.
Center와 Spread는 반드시 함께 해석해야 합니다.
Range가 같아도 IQR이 다른 예
Group A
0
40
45
50
55
60
100
Group B
0
5
10
50
90
95
100
두 Group 모두 Range는 100입니다.
하지만 중앙 Data의 Spread는 크게 다를 수 있습니다.
즉 Range는 동일하지만 IQR은 다른 구조가 가능합니다.
IQR이 같아도 Range가 다를 수 있을까?
물론입니다.
Dataset A
0
20
30
40
50
60
70
Dataset B
-1000
20
30
40
50
60
5000
중앙 Data가 동일하다면 Q1과 Q3는 비슷하고 IQR도 비슷할 수 있습니다.
하지만 Minimum과 Maximum이 크게 달라져 Range는 매우 달라집니다.
이 사례는 IQR의 Robustness를 잘 보여줍니다.
SAS Enterprise Guide에서는 Quartile과 IQR을 어떻게 확인할까?
첨부 교재의 Summary Statistics 실습에서는 Percentile Statistics에서 다음 값을 선택하도록 안내합니다.
- First Quartile
- Median
- Third Quartile
그리고 이 값을 이용하여 IQR을 계산합니다.
예를 들어 BodyTemp에서는:
Q1 = 97.80
Median = 98.30
Q3 = 98.70
이므로:
IQR = 0.90
입니다.
Summary Statistics에서 Range도 직접 볼 수 있을까?
Minimum과 Maximum이 출력된다면 쉽게 계산할 수 있습니다.
예를 들어 SATScore Example에서는:
Minimum = 890
Maximum = 1600
이므로:
Range = 710
입니다.
즉 Summary Statistics Output에서:
- Minimum
- Maximum
- Q1
- Median
- Q3
를 확보하면 Range와 IQR을 모두 계산할 수 있습니다.
Distribution Analysis Task와 함께 보면 더 좋은 이유
첨부 교재에서는 NORMTEMP Data에 대해 Summary Statistics뿐 아니라 Distribution Analysis Task를 사용하여:
- Histogram
- Probability Plot
- Box Plot
- Minimum
- Maximum
- Mean
- Standard Deviation
- Skewness
- Kurtosis
등을 함께 확인하도록 구성합니다.
이는 Spread Statistic 하나만으로 Distribution을 판단하지 말고 Graph와 함께 확인해야 한다는 의미로 이해할 수 있습니다.
Box Plot에서 IQR이 시각적으로 보이는 이유
Box Plot의 Box가 Q1부터 Q3까지를 나타내므로 Box의 크기가 IQR과 직접 연결됩니다.
두 Group의 Box Plot을 나란히 보면:
- Median 차이
- IQR 차이
- Skewness
- Potential Outlier
를 시각적으로 비교할 수 있습니다.
따라서 IQR은 단순한 숫자가 아니라 Visualization과도 강하게 연결된 Statistic입니다.
Range는 Plot에서 어떻게 보일까?
전체 Minimum과 Maximum을 확인하면 Range를 이해할 수 있습니다.
하지만 Box Plot에서는 일부 Extreme Observation이 별도 점으로 표시될 수 있으므로 Whisker만 보고 전체 Range라고 단정하면 안 됩니다.
Actual Min/Max Statistic과 Plot Definition을 함께 확인하는 것이 좋습니다.
IQR을 이용해 Outlier를 찾는 전체 흐름
다음 구조로 이해할 수 있습니다.
Q1 계산
↓
Q3 계산
↓
IQR = Q3 – Q1
↓
Lower Fence
Q1 – 1.5×IQR
↓
Upper Fence
Q3 + 1.5×IQR
↓
Fence 밖 Observation 확인
↓
Potential Outlier
↓
Source / Context Review
중요한 점은 마지막 단계입니다.
Potential Outlier가 확인되어도 바로 제거하지 않습니다.
Extreme Value는 왜 중요한 정보일 수도 있을까?
예를 들어 Clinical Data에서 극단적인 Biomarker Value가 실제 Severe Patient의 특징일 수 있습니다.
Fraud Detection에서는 Extreme Transaction이 바로 관심 대상일 수 있습니다.
Manufacturing에서는 Extreme Measurement가 Process Failure의 신호일 수 있습니다.
따라서 Outlier는 단순히 불편한 Data가 아니라 중요한 Signal일 수 있습니다.
Range가 넓다고 무조건 Variation이 큰 Population일까?
반드시 그렇지 않습니다.
Sample에 우연히 Extreme Observation 하나가 포함되어 Range가 커졌을 수 있습니다.
또 Sample Size가 커서 더 극단적인 값이 관찰되었을 수도 있습니다.
따라서 Population Dispersion을 판단할 때 Range 하나만 사용하는 것은 제한적입니다.
IQR이 Population Spread를 완전히 설명할까?
그렇지도 않습니다.
IQR은 중앙 50%를 의도적으로 요약합니다.
따라서 Tail에 존재하는 중요한 정보를 제거하는 것은 아니지만 Summary Statistic 자체에는 반영하지 않습니다.
Risk Analysis처럼 Tail 자체가 중요한 분야에서는 IQR만으로 충분하지 않을 수 있습니다.
그래서 여러 Spread Statistic을 함께 사용할 수 있다
Data 특성에 따라 다음을 함께 볼 수 있습니다.
- Minimum
- Maximum
- Range
- Q1
- Q3
- IQR
- Variance
- Standard Deviation
각 Statistic이 서로 다른 부분을 보여줍니다.
Range
전체 폭
IQR
중앙 폭
SD
Mean 기반 전체 Dispersion
입니다.
어떤 Statistic이 가장 좋다고 말하기 어려운 이유
통계량마다 목적이 다르기 때문입니다.
예를 들어:
전체 Observed Boundary가 궁금함
↓
Range
Typical Middle Spread가 궁금함
↓
IQR
Mean 주변 전체 Variation이 궁금함
↓
Standard Deviation
을 사용할 수 있습니다.
따라서 하나의 Statistic이 다른 모든 Statistic보다 항상 우월한 것은 아닙니다.
Spread Measure 선택의 기본 구조
다음과 같이 생각할 수 있습니다.
Continuous Data
↓
Distribution 확인
Symmetric
↓
Mean + SD
Min/Max 필요 시 확인
Skewed / Extreme Outlier
↓
Median + IQR
Min/Max 필요 시 확인
Ordinal Data
↓
Median + IQR 고려
이 구조는 첨부 교재에서 제시한 Dispersion Measure 선택 원리와 연결됩니다.
Range와 IQR이 Statistical Test에 직접 들어갈까?
일반적인 t-Test나 ANOVA에서는 Variance와 Standard Deviation 같은 Mean-based Variability가 더 직접적으로 사용됩니다.
Range와 IQR은 주로 Descriptive Summary와 Data Exploration에서 유용합니다.
하지만 IQR은 Robust Statistics와 Outlier Detection에서 매우 중요한 역할을 합니다.
즉 Statistic마다 분석 과정에서의 역할이 다릅니다.
IQR과 Standard Deviation을 숫자만으로 직접 비교할 수 있을까?
같은 단위를 사용하지만 의미가 다릅니다.
SD는 모든 Observation의 Mean-based Spread이고,
IQR은 중앙 50%의 Range입니다.
따라서:
SD = 10
IQR = 10
이라고 해서 둘이 같은 정도의 Spread를 의미한다고 단순 해석하면 안 됩니다.
Distribution에 따라 두 Statistic의 관계가 달라집니다.
Normal Distribution에서는 IQR과 SD가 일정한 관계를 가질까?
Normal Distribution에서는 Percentile 위치가 Standard Deviation과 일정한 관계를 가지므로 IQR도 SD와 일정한 비례 관계를 가집니다.
하지만 이 관계는 Distribution Shape에 의존합니다.
따라서 실제 Data가 Normal이 아닌데 IQR과 SD를 기계적으로 변환하면 안 됩니다.
이 글에서는 해당 수학적 변환보다 두 Statistic이 어떤 Data 영역을 요약하는지를 이해하는 것이 중요합니다.
Range와 IQR은 Missing Value의 영향을 받을까?
Missing 자체는 Observation 값으로 계산되지 않는다면 직접 Min/Max나 Quartile에 포함되지 않을 수 있습니다.
하지만 Missing 때문에 실제 사용되는 Sample Size와 Data Distribution이 달라질 수 있습니다.
특히 Missing이 특정 Value Range에 집중되어 있다면 Observed Range나 IQR이 실제 Population Distribution과 다르게 나타날 수 있습니다.
따라서 Missing Pattern도 함께 확인해야 합니다.
Data Filtering 후 Range와 IQR이 바뀌는 이유
예를 들어 전체 Patient Data에서:
Age 18~90
이었는데 특정 Subgroup만 Filter하면:
Age 65~90
이 될 수 있습니다.
Range와 IQR 모두 달라집니다.
따라서 Summary Statistic을 비교할 때 동일한 Analysis Population을 사용했는지 확인해야 합니다.
Dataset Version이 바뀌면 Quartile도 바뀔 수 있다
새로운 Data가 추가되거나 기존 값이 수정되면:
- Minimum
- Maximum
- Q1
- Median
- Q3
가 모두 바뀔 수 있습니다.
따라서 Final Analysis에서는 최신 Dataset에 대한 Summary Statistics를 다시 생성하는 것이 중요합니다.
SAS Output에서 Min·Max만 보고 끝내면 안 되는 이유
Minimum과 Maximum은 매우 유용하지만 Tail만 보여줍니다.
예를 들어:
Min = 0
Max = 1000
이라는 정보만으로 대부분 Data가 어디에 있는지 알 수 없습니다.
Q1, Median, Q3를 함께 보면 Distribution 내부 구조를 더 잘 이해할 수 있습니다.
IQR만 보고 전체 Data 범위를 놓치면 안 되는 이유
반대로 IQR이 작다고 해서 Extreme Observation이 없다는 의미는 아닙니다.
예를 들어:
Q1 = 50
Q3 = 55
IQR = 5
이지만 Maximum이 1,000일 수 있습니다.
따라서 Robust Summary와 전체 Boundary를 함께 보는 것이 좋습니다.
좋은 Descriptive Summary의 예
Skewed Data라면 다음 정보를 같이 제시할 수 있습니다.
N
100
Median
52
Q1–Q3
48–60
IQR
12
Min–Max
10–500
이렇게 하면:
- Center
- Typical Spread
- Overall Range
- Extreme Tail 가능성
을 모두 이해할 수 있습니다.
Range와 IQR의 전체 구조
지금까지 내용을 정리하면 다음과 같습니다.
Data
↓
정렬
↓
전체 Spread가 궁금하다
Minimum
↓
Maximum
↓
Range = Max – Min
중앙 Spread가 궁금하다
Q1
↓
Median
↓
Q3
↓
IQR = Q3 – Q1
즉:
Range
↓
100% Observed Span
반면:
IQR
↓
Middle 50% Span
입니다.
흔한 오해 정리
“Range가 크면 대부분 Data가 넓게 퍼져 있다”
반드시 그렇지 않습니다.
Extreme Value 하나 때문에 Range가 커질 수 있습니다.
“IQR은 Maximum – Minimum이다”
아닙니다.
IQR은 Q3 – Q1입니다.
“Q1은 최소값이다”
아닙니다.
Q1은 25th Percentile입니다.
“Q3은 최대값이다”
아닙니다.
Q3는 75th Percentile입니다.
“IQR에는 전체 Data의 75%가 포함된다”
아닙니다.
Q1과 Q3 사이에는 중앙 약 50%의 Data가 위치합니다.
“IQR이 작으면 Outlier가 없다”
아닙니다.
오히려 중앙 Data는 좁게 모여 있으면서 Tail에 Extreme Value가 있을 수 있습니다.
“Range와 IQR 중 하나만 항상 사용하면 된다”
아닙니다.
두 Statistic은 서로 다른 Data 영역을 설명합니다.
“1.5×IQR 밖의 값은 Data Error다”
아닙니다.
Potential Outlier를 탐색하는 기준일 뿐입니다.
“Skewed Data는 Range를 보고하면 안 된다”
그렇지 않습니다.
Range는 전체 Observed Boundary를 보여주는 정보로 여전히 활용할 수 있습니다.
“IQR은 Outlier를 삭제해서 계산한다”
아닙니다.
중앙 50%를 기준으로 계산하기 때문에 Extreme Value 영향이 상대적으로 작은 것입니다.
SAS에서 Range와 IQR을 확인하는 기본 흐름
다음처럼 진행할 수 있습니다.
Summary Statistics
↓
Minimum 확인
↓
Maximum 확인
↓
Range 계산
그리고:
Q1 확인
↓
Median 확인
↓
Q3 확인
↓
IQR 계산
그 다음:
Distribution Analysis
↓
Histogram
Box Plot
↓
Extreme Value / Skewness 확인
첨부 교재의 Summary Statistics와 Distribution Analysis 실습도 이러한 Descriptive Review 흐름을 보여줍니다.
왜 이 개념을 이해해야 할까?
다음 글에서 다루게 될 Percentile, Quartile, Distribution, Skewness와 직접 연결되기 때문입니다.
전체 흐름을 보면:
Range
↓
전체 Data Boundary
Quartile
↓
Data Relative Position
IQR
↓
Central Spread
Box Plot
↓
Quartile 기반 Visualization
Outlier
↓
IQR 기반 탐색 가능
Skewness
↓
Center와 Tail의 비대칭
으로 이어집니다.
즉 Range와 IQR은 단순한 두 개의 Formula가 아니라 Distribution Structure를 이해하는 중요한 출발점입니다.
핵심 정리
Range와 Interquartile Range는 모두 Data의 Spread를 나타내지만 서로 다른 영역을 사용합니다.
첨부 교재에서는 Range를:
Maximum – Minimum
으로 정의합니다.
즉 Data 전체의 Observed Span을 보여줍니다.
반면 IQR은:
Q3 – Q1
즉:
75th Percentile – 25th Percentile
로 계산하며 Data의 중앙 50%가 차지하는 범위를 보여줍니다.
전체 구조는 다음과 같습니다.
Range
↓
전체 Data 사용 범위
↓
Extreme Value에 매우 민감
반면:
IQR
↓
Middle 50% 사용
↓
Extreme Value에 상대적으로 Robust
따라서 Distribution이 비교적 대칭적이고 Mean이 적절한 경우에는 Mean과 Standard Deviation을 사용할 수 있지만, Skewed Distribution이나 여러 Extreme Outlier가 존재하거나 Ordinal Variable을 다루는 경우에는 Median과 IQR이 더 적절한 Summary가 될 수 있습니다. 첨부 교재도 이러한 상황에서 IQR을 권장하는 구조를 설명합니다.
또한 SAS Enterprise Guide의 Summary Statistics 실습에서는 Q1, Median, Q3를 출력하여 IQR을 계산하고, Distribution Analysis에서는 Histogram과 Box Plot을 함께 확인하도록 구성합니다.
Range는 Data가 어디서부터 어디까지 존재하는지를 보여주고, IQR은 대부분의 중심 Data가 실제로 어느 정도 범위에 모여 있는지를 보여줍니다.
따라서 Spread를 제대로 이해하려면 전체 Boundary와 중앙 Distribution을 구분해서 보는 것이 중요합니다.
함께 읽으면 좋은 글
- Variance와 Standard Deviation의 의미: 평균만으로 데이터 변동성을 설명할 수 없는 이유
- Percentile과 Quartile의 구조: 데이터의 상대적 위치와 분포를 해석하는 방식
- Distribution을 먼저 확인해야 하는 이유: 데이터의 위치·산포·형태를 점검하는 과정
- Skewness와 Extreme Value의 영향: 비대칭 분포와 극단값이 통계량을 왜곡하는 방식
- Summary Statistics Task의 구조: SAS Enterprise Guide에서 기술통계를 생성하는 원리
참고한 자료
- SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
- Fundamental Statistical Concepts
- Percentiles and Quartiles
- The Spread of a Distribution: Dispersion
- Range and Interquartile Range
- Summary Statistics Task
- Distribution Analysis Task




댓글 0
첫 댓글을 남겨보세요.