본문 바로가기
SAS 알려주는 블로그 SAS 알려주는 블로그

Summary Statistics Task의 구조: SAS Enterprise Guide에서 기술통계를 생성하는 원리

읽는 시간 약 55분

앞선 글들에서는 Mean, Median, Standard Deviation, Quartile, IQR, Skewness처럼 Data를 이해하기 위한 다양한 Descriptive Statistic을 살펴봤습니다.

그렇다면 SAS Enterprise Guide에서는 이러한 기술통계를 실제로 어떻게 생성할까요?

대표적인 방법이 Summary Statistics Task입니다.

첨부 교재에서는 Summary Statistics Task를 Data에 대한 Descriptive Statistics를 생성하는 기능으로 설명합니다.

Summary Statistics Task의 핵심은 단순히 평균을 계산하는 것이 아니라, 분석할 Variable과 Grouping Variable을 지정하고 필요한 Summary Measure를 선택하여 Data의 중심·산포·범위를 구조적으로 확인하는 데 있습니다.

즉 Task는 Statistic을 자동으로 계산해주는 메뉴이면서 동시에 Data를 본격적으로 분석하기 전에 구조를 점검하는 도구입니다.

Summary Statistics Task란 무엇인가?

Summary Statistics Task는 SAS Enterprise Guide에서 Descriptive Statistics를 생성하기 위한 Task입니다.

첨부 교재에서는 이를 명확하게 다음 목적과 연결합니다.

Summary Statistics Task

Data의 Descriptive Statistics 생성

예를 들어 Continuous Variable에 대해 다음과 같은 Statistic을 확인할 수 있습니다.

  • Mean
  • Standard Deviation
  • Minimum
  • Maximum
  • Quartile
  • Median

분석 목적에 따라 필요한 Statistic을 선택할 수 있습니다.

왜 Summary Statistics가 Statistical Analysis의 초반에 등장할까?

첨부 교재의 Chapter 2에서도 본격적인 Inferential Statistics보다 앞서 Summary Statistics를 이용하여 Sample Data를 먼저 탐색하도록 구성합니다.

이유는 간단합니다.

Statistical Model을 적용하기 전에 다음을 먼저 알아야 하기 때문입니다.

  • Data가 몇 개 존재하는가?
  • 값의 범위는 정상적인가?
  • 중심은 어디에 있는가?
  • 얼마나 퍼져 있는가?
  • 예상하지 못한 값이 있는가?

즉:

Raw Data

Summary Statistics

Data Structure 이해

Inferential Analysis

라는 순서입니다.

Summary Statistics Task는 평균만 만드는 기능일까?

아닙니다.

이름 때문에 단순히 Mean을 만드는 기능처럼 생각하기 쉽지만 실제 목적은 더 넓습니다.

예를 들어 Body Temperature Data를 분석한다면 다음 Statistic을 함께 확인할 수 있습니다.

Mean

Center

Standard Deviation

Spread

Minimum / Maximum

전체 범위

Quartile

Distribution의 상대적인 위치

즉 Statistic 하나가 아니라 여러 Summary Measure를 함께 생성해 Data Distribution의 기본 구조를 파악할 수 있습니다.

첨부 교재의 TESTSCORES Example

교재에서는 TESTSCORES Dataset을 이용하여 Summary Statistics Task를 실습합니다.

분석 대상 Variable은 SATScore입니다.

첨부 교재에서는 TESTSCORES Dataset을 Process Flow 또는 Project Explorer에서 찾은 뒤 Summary Statistics Task를 사용하여 SATScore에 대한 Descriptive Statistics를 생성하도록 안내합니다.

전체 흐름은 다음과 같습니다.

TESTSCORES Dataset

SATScore 선택

Summary Statistics Task

Descriptive Statistics 생성

왜 SATScore를 Analysis Variable로 지정할까?

Analysis Variable은 Statistic을 실제로 계산할 대상입니다.

예를 들어 SATScore에 대해:

  • Mean
  • Standard Deviation
  • Minimum
  • Maximum

을 계산하고 싶다면 SATScore가 Analysis Variable이 됩니다.

즉:

Analysis Variable

“어떤 Variable의 값을 요약할 것인가?”

를 의미합니다.

Analysis Variable에는 어떤 Variable을 넣어야 할까?

일반적으로 Mean이나 Standard Deviation 같은 Numeric Summary를 계산하려면 Quantitative Variable을 선택합니다.

예를 들어:

  • SATScore
  • BodyTemp
  • Height
  • Weight
  • Blood Pressure

같은 Variable입니다.

반면 SubjectID처럼 단순 Identifier를 Analysis Variable로 넣어 Mean을 계산하는 것은 Statistical Meaning이 없을 수 있습니다.

Numeric Variable이라고 모두 Analysis Variable로 적절할까?

아닙니다.

예를 들어 Region을 다음과 같이 Numeric Code로 저장했다고 가정해보겠습니다.

1 = Korea

2 = USA

3 = Japan

SAS에서는 Numeric Variable이므로 Mean 계산 자체는 가능할 수 있습니다.

하지만:

Mean Region = 1.8

이라는 값에는 의미 있는 Statistical Interpretation이 없습니다.

따라서:

SAS Data Type

Measurement Scale

을 구분해야 합니다.

Task가 계산할 수 있는 Variable과 계산하는 것이 통계적으로 의미 있는 Variable은 서로 다를 수 있습니다.

Classification Variable이란 무엇인가?

Summary Statistics Task에서는 Group별 Summary를 만들기 위해 Classification Variable을 사용할 수 있습니다.

예를 들어 BodyTemp를 Gender별로 비교하고 싶다고 가정해보겠습니다.

이 경우:

Analysis Variable

BodyTemp

그리고:

Classification Variable

Gender

가 됩니다.

즉:

Gender

Male / Female

각 Group별 BodyTemp Summary

형태가 됩니다.

Classification Variable은 어떤 역할을 할까?

Classification Variable은 전체 Data를 Category별로 나누어 각 Group에서 Statistic을 계산하게 합니다.

예를 들어:

Treatment = Placebo / Drug

이라면:

Placebo

Mean

SD

N

그리고:

Drug

Mean

SD

N

을 따로 생성할 수 있습니다.

즉 Summary Statistics Task는 전체 Summary뿐 아니라 Subgroup Summary를 생성하는 데도 사용할 수 있습니다.

첨부 교재에서는 Classification Variable을 어떻게 사용하나?

교재의 Two-Way ANOVA 관련 Exercise에서는 Summary Statistics Task를 이용해:

Strength

를 Analysis Variable로,

Additive

Brand

를 Classification Variable로 지정하도록 합니다.

이는 본격적인 Two-Way ANOVA를 실행하기 전에 각 Factor Combination에서 Strength Data가 어떻게 분포하는지 확인하기 위한 접근으로 이해할 수 있습니다.

왜 ANOVA 전에 Summary Statistics를 확인할까?

ANOVA는 Group Mean을 비교합니다.

따라서 Model을 실행하기 전에 Group별로 다음을 확인하는 것이 중요합니다.

  • N
  • Mean
  • Standard Deviation
  • Minimum
  • Maximum

예를 들어:

Group A

Mean = 50

SD = 2

Group B

Mean = 60

SD = 30

이라면 Mean Difference뿐 아니라 Group Variability도 매우 다르다는 사실을 알 수 있습니다.

이 정보는 ANOVA Result를 해석할 때 중요합니다.

Summary Statistics Task의 기본 구조

전체 구조를 단순화하면 다음과 같습니다.

Input Dataset

Analysis Variable 선택

무엇을 요약할 것인가?

Classification Variable 선택

어떤 Group별로 볼 것인가?

Statistics 선택

Mean / SD / Min / Max / Quartile 등

Run

SAS Code 실행

Result

이 구조는 SAS Enterprise Guide의 다른 Task와도 유사합니다.

Task를 실행하면 실제로 무엇이 일어날까?

앞선 글에서 살펴본 것처럼 SAS Enterprise Guide의 Task는 GUI 설정을 실제 SAS Code로 변환합니다.

따라서 Summary Statistics Task에서도:

GUI 설정

SAS Code 생성

SAS에 Submit

Statistical Calculation

Result 반환

과정을 거칩니다.

즉 Task가 별도의 통계 Engine을 가지는 것이 아니라 SAS Program 실행을 GUI로 구성한다고 이해할 수 있습니다.

Summary Statistics Task의 장점은 무엇일까?

초보자가 SAS Syntax를 모두 외우지 않아도 Descriptive Statistics를 빠르게 생성할 수 있습니다.

예를 들어 GUI에서:

SATScore 선택

Mean 선택

Standard Deviation 선택

Minimum / Maximum 선택

Run

만으로 Summary Table을 만들 수 있습니다.

하지만 Task의 진짜 장점은 단순 Convenience보다 반복 가능한 Analysis Structure를 만들 수 있다는 점입니다.

Task 결과는 Process Flow에 남을까?

SAS Enterprise Guide에서는 Task가 Project와 Process Flow 안에서 관리됩니다.

따라서:

Dataset

Summary Statistics Task

Result

의 관계가 Process Flow에서 연결됩니다.

이 구조를 사용하면 어떤 Data에서 어떤 분석을 수행했는지 확인하기 쉽습니다.

Summary Statistics Task를 수정할 수 있을까?

가능합니다.

첨부 교재에서는 이미 실행한 Summary Statistics Task를 다시 열어 수정하는 과정도 보여줍니다.

예를 들어 BodyTemp의 Confidence Interval을 생성하는 Exercise에서 기존 Task Icon을 Right-click한 뒤 Modify Summary Statistics를 선택하도록 안내합니다.

즉 Task를 처음부터 다시 만들 필요 없이 기존 설정을 수정하여 다시 실행할 수 있습니다.

기존 Task를 수정하는 것이 왜 유용할까?

예를 들어 처음에는:

Mean

SD

만 확인했다고 가정해보겠습니다.

이후:

Quartile

Confidence Interval

을 추가하고 싶을 수 있습니다.

이때 기존 Task를 수정하면 동일한 Analysis Variable과 기본 설정을 유지하면서 필요한 Option만 추가할 수 있습니다.

즉:

기존 Analysis

Option 수정

재실행

Updated Result

가 가능합니다.

Summary Statistics Result에서 가장 먼저 볼 것은 무엇일까?

보통 다음 순서가 좋습니다.

1. N

실제 몇 개 Observation이 사용되었는가?

2. Mean / Median

Center는 어디인가?

3. Standard Deviation

Data가 얼마나 퍼져 있는가?

4. Minimum / Maximum

비정상적인 범위가 있는가?

5. Quartile

Distribution의 중앙 구조는 어떤가?

즉 Mean부터 보더라도 그것만 보고 끝내지 않는 것이 중요합니다.

N을 먼저 확인해야 하는 이유

예를 들어 전체 Dataset에는 1,000개의 Observation이 있다고 가정해보겠습니다.

그런데 SATScore Summary에서:

N = 920

이라고 나온다면 80개의 Missing Value가 있을 수 있습니다.

따라서 Mean이 얼마인지 보기 전에:

왜 N이 920인가?

를 확인해야 합니다.

Missing Value가 Summary Statistics에 미치는 영향

Continuous Variable의 Summary에서는 일반적으로 Missing Value가 Statistic 계산에서 제외될 수 있습니다.

따라서 Variable마다 Analysis N이 다를 수 있습니다.

예:

Age N = 1000

Weight N = 980

Outcome N = 850

이런 차이를 확인하지 않고 Mean만 비교하면 실제 사용된 Sample Size를 놓칠 수 있습니다.

Mean을 확인할 때 같이 볼 Statistic

Mean 하나만 보는 것보다 다음을 함께 보는 것이 좋습니다.

Mean

Standard Deviation

Median

Min / Max

예를 들어:

Mean = 100

Median = 50

Maximum = 1000

이라면 Distribution이 Right-Skewed하거나 Extreme Value가 있을 가능성을 생각할 수 있습니다.

Standard Deviation은 무엇을 확인하게 해줄까?

같은 Mean을 가진 Group이라도 SD는 크게 다를 수 있습니다.

예:

Group A

Mean = 80

SD = 3

Group B

Mean = 80

SD = 30

이 경우 두 Group의 Center는 같지만 Variability는 완전히 다릅니다.

따라서 Group Comparison 전에는 Mean과 SD를 함께 확인해야 합니다.

Minimum과 Maximum이 중요한 이유

Min과 Max는 Data Quality Check에 매우 유용합니다.

예를 들어 Body Temperature에서:

Minimum = 96.3

Maximum = 100.8

처럼 나올 수 있습니다.

첨부 교재의 BodyTemp Example에서도 이러한 Statistic과 함께 Mean 98.25, Standard Deviation 0.73을 제시합니다.

이처럼 Min/Max는 Data가 예상 가능한 Range 안에 있는지 확인하는 데 도움을 줍니다.

BodyTemp Example은 무엇을 보여줄까?

첨부 교재의 BodyTemp Result에서는 다음 값이 제시됩니다.

  • Minimum = 96.30
  • Maximum = 100.80
  • Mean = 98.25
  • Standard Deviation = 0.73
  • Skewness = -0.00
  • Kurtosis = 0.78

이 Example은 Summary와 Distribution 관련 Statistic을 이용하여 Sample Body Temperature의 기본적인 구조를 파악할 수 있다는 점을 보여줍니다.

Mean 98.25만 보면 충분할까?

아닙니다.

Mean 98.25만 보면 Sample의 중심만 알 수 있습니다.

하지만:

SD = 0.73

을 보면 Individual Body Temperature가 어느 정도 퍼져 있는지 알 수 있습니다.

또:

Min = 96.30

Max = 100.80

을 보면 Observed Range를 알 수 있습니다.

즉 Result는 여러 Statistic을 함께 읽어야 합니다.

Quartile은 왜 Summary Statistics에서 중요할까?

Quartile은 Distribution을 Rank-based 방식으로 이해하게 해줍니다.

대표적으로:

  • Q1
  • Median
  • Q3

를 확인할 수 있습니다.

이를 이용해:

IQR = Q3 – Q1

을 계산할 수 있습니다.

Skewed Data나 Extreme Value가 있는 경우 Mean과 SD뿐 아니라 Quartile을 확인하는 것이 특히 유용합니다.

첨부 교재의 NORMTEMP Exercise

교재에서는 NormTemp Dataset을 이용하여 Summary Statistics Task로 다음 질문에 답하도록 합니다.

  • 전체 BodyTemp의 Mean과 Standard Deviation은 얼마인가?
  • BodyTemp의 Interquartile Range는 얼마인가?

즉 Summary Statistics Task는 Center와 Spread를 동시에 이해하기 위한 실습 도구로 사용됩니다.

Mean과 SD만으로 IQR을 알 수 있을까?

아닙니다.

IQR은 Quartile 기반 Statistic입니다.

따라서:

Q1

Q3

가 필요합니다.

즉 Summary Statistics Task에서 Percentile 또는 Quartile Statistic을 추가로 선택해야 합니다.

왜 Summary Statistic을 필요에 따라 선택해야 할까?

모든 Data에 같은 Statistic이 적절한 것은 아니기 때문입니다.

Symmetric Continuous Data

Mean + SD

Skewed Continuous Data

Median + IQR

Categorical Data

Frequency + Percentage

같은 차이가 있습니다.

따라서 Task에서 많은 Option이 있다고 해서 모든 Statistic을 무조건 출력해야 하는 것은 아닙니다.

많이 출력할수록 좋은 분석일까?

그렇지 않습니다.

필요하지 않은 Statistic을 지나치게 많이 출력하면 핵심 정보가 묻힐 수 있습니다.

예를 들어 Nominal Code에 Mean을 출력하거나 Identifier에 SD를 계산하는 것은 의미가 없습니다.

따라서:

Research Question

Measurement Scale

Distribution

에 맞게 Statistic을 선택해야 합니다.

Analysis Variable을 여러 개 넣을 수 있을까?

여러 Continuous Variable의 Summary가 필요한 경우 여러 Variable을 선택할 수 있습니다.

예를 들어:

  • Age
  • Weight
  • HeartRate

를 함께 Summary하면 Dataset의 기본적인 Profile을 빠르게 확인할 수 있습니다.

하지만 Variable마다 Unit과 Meaning이 다르므로 Result Interpretation은 각각 따로 해야 합니다.

여러 Variable의 Mean을 서로 직접 비교해도 될까?

주의해야 합니다.

예를 들어:

Age Mean = 68

Weight Mean = 72

라고 해서 Weight가 Age보다 “크다”고 비교하는 것은 의미가 없습니다.

Unit과 Scale이 다르기 때문입니다.

Summary Table 안에 같이 있다고 해서 Statistic끼리 직접 비교 가능한 것은 아닙니다.

Classification Variable을 여러 개 사용하면?

여러 Grouping Variable을 사용하면 더 세분화된 Summary를 만들 수 있습니다.

첨부 교재의 Concrete Example에서는:

Additive

Brand

를 Classification Variable로 사용하여 Strength를 요약합니다.

개념적으로:

Additive

×

Brand

각 Combination별 Strength Summary

를 확인할 수 있습니다.

왜 두 Classification Variable의 순서도 확인해야 할까?

교재에서는 Additive와 Brand를 특정 순서로 Classification Variable Role에 넣도록 안내합니다.

이는 Output의 Grouping Structure와 표시 순서에 영향을 줄 수 있습니다.

따라서 여러 Classification Variable을 사용할 때는 어떤 Variable이 상위 Grouping인지 확인하는 것이 좋습니다.

Summary Statistics는 Group Interaction을 검정할까?

아닙니다.

Group별 Mean을 보여준다고 해서 Interaction을 Statistical Test한 것은 아닙니다.

예를 들어 Additive와 Brand 조합별 Mean을 보고 Pattern을 탐색할 수는 있습니다.

하지만 두 Factor 사이 Interaction이 Statistically Significant한지는 Two-Way ANOVA 같은 Model에서 별도로 평가해야 합니다.

Descriptive Pattern과 Inferential Evidence는 구분해야 합니다.

Group Mean 차이가 크면 ANOVA도 유의할까?

반드시 그렇지 않습니다.

Group Mean Difference뿐 아니라 다음도 중요합니다.

  • Within-Group Variability
  • Sample Size
  • Number of Groups

따라서 Summary Statistics에서 Mean 차이가 커 보여도 ANOVA p-value가 반드시 작다고 단정할 수 없습니다.

반대로 작은 Difference도 Sample Size가 매우 크면 Statistical Significance가 나타날 수 있습니다.

Summary Statistics는 Hypothesis Test일까?

아닙니다.

Summary Statistics는 기본적으로 Data를 설명하는 Descriptive Analysis입니다.

Mean 50과 Mean 60을 보여주는 것은:

“두 Group Mean이 10 차이 난다.”

는 Descriptive Fact입니다.

하지만:

“Population Mean이 실제로 다르다.”

는 결론은 Inferential Statistics가 필요합니다.

왜 Descriptive와 Inferential을 구분해야 할까?

Sample의 Difference가 Population Difference를 의미하는지 평가하려면 Sampling Variability를 고려해야 하기 때문입니다.

따라서:

Summary Statistics

Sample Description

그리고:

t-Test / ANOVA / Regression

Population Inference

를 구분해야 합니다.

Summary Statistics에서 Confidence Interval도 생성할 수 있을까?

첨부 교재의 BodyTemp Exercise에서는 기존 Summary Statistics Task를 수정하여 Mean의 95% Confidence Interval을 생성하도록 안내합니다.

이는 같은 Task가 단순 Descriptive Statistics에서 한 단계 확장되어 Parameter Estimation에도 활용될 수 있음을 보여줍니다.

Point Estimate와 Confidence Interval을 함께 보는 이유

Mean 하나는 Point Estimate입니다.

예:

Mean = 98.25

하지만 Population Mean의 Uncertainty를 표현하려면 Confidence Interval이 필요합니다.

즉:

Sample Mean

Point Estimate

Confidence Interval

Uncertainty

를 함께 볼 수 있습니다.

Task의 Option을 수정하면 분석 목적도 달라질 수 있다

처음에는 단순 Descriptive Summary를 위해 Task를 만들었다가 이후:

  • Quartile 추가
  • Confidence Interval 추가
  • Grouping Variable 추가

등으로 확장할 수 있습니다.

따라서 Summary Statistics Task는 고정된 출력 하나를 만드는 기능이 아니라 설정에 따라 분석 질문을 확장할 수 있는 구조입니다.

기존 Task를 복사하는 것과 수정하는 것은 다를까?

목적에 따라 선택할 수 있습니다.

기존 결과를 보존하고 다른 Option을 비교하려면 새 Task를 만들거나 복제하는 것이 좋을 수 있습니다.

반대로 기존 Analysis를 Update하려는 목적이라면 Modify가 적절할 수 있습니다.

중요한 것은 어느 결과가 어떤 설정에서 생성되었는지 관리하는 것입니다.

Process Flow에서 Task Name을 관리해야 하는 이유

Summary Statistics Task가 여러 개 생기면 기본 이름만으로 구분하기 어려울 수 있습니다.

예를 들어:

Summary Statistics

Summary Statistics 2

Summary Statistics 3

보다:

SATScore Summary

BodyTemp Summary

Strength by Brand

처럼 이름을 지정하면 Process Flow를 이해하기 쉽습니다.

이는 Reproducibility와 Review에도 도움이 됩니다.

Task Result만 보지 말고 Input Data도 확인해야 하는 이유

Summary Statistics가 이상하다면 먼저 Source Data를 확인해야 합니다.

예를 들어:

Mean Weight = 350

이라고 나왔다면 Statistic 자체를 의심하기보다:

  • Unit가 lb인가?
  • kg와 lb가 섞였는가?
  • Missing Code가 포함되었는가?
  • 잘못된 Observation이 있는가?

를 먼저 확인합니다.

SAS는 입력된 숫자를 계산할 뿐 Data Meaning을 자동으로 판단하지 않습니다.

Summary Statistics로 Data Error를 찾는 방법

예를 들어 다음 Statistic이 있다고 가정해보겠습니다.

Age:

Mean = 68

Minimum = 18

Maximum = 999

이 경우 Maximum 999가 의심됩니다.

가능한 원인은:

  • Missing Code
  • Data Entry Error
  • Import Error

입니다.

즉 Min/Max는 매우 간단하지만 강력한 QC Tool입니다.

Mean과 Median의 차이도 QC Signal이 될까?

가능합니다.

예:

Mean = 150

Median = 60

이라면 Right Skew나 Extreme Value를 확인할 수 있습니다.

다음 단계로:

Histogram

Box Plot

Raw Data

를 확인하면 됩니다.

즉 Summary Statistics는 문제를 해결하는 마지막 단계가 아니라 추가 확인이 필요한 위치를 알려주는 첫 번째 신호입니다.

SD가 비정상적으로 크면 무엇을 확인할까?

다음 흐름을 사용할 수 있습니다.

SD 확인

예상보다 큼

Min / Max 확인

Mean / Median 비교

Unit 확인

Extreme Value 확인

Distribution Analysis

즉 Statistic 하나가 다른 Diagnostic으로 연결됩니다.

SD가 0이면?

모든 Valid Observation이 같은 값일 가능성을 확인할 수 있습니다.

예:

Response = 1

1

1

1

이라면 SD = 0입니다.

하지만 Data Import 또는 Coding 과정에서 Variable이 잘못 고정된 것은 아닌지도 확인해야 합니다.

Minimum과 Maximum이 같다면?

Range가 0이라는 의미입니다.

즉 모든 값이 동일합니다.

이것이 실제 Data Structure인지 아니면 Data Processing Error인지 Context에 따라 확인해야 합니다.

Group별 N이 크게 다르면?

예를 들어:

Placebo n = 500

Drug n = 50

이라면 Group Balance를 확인해야 합니다.

Study Design 자체가 불균형할 수도 있고 Missing이나 Filtering 때문에 특정 Group Data가 빠졌을 수도 있습니다.

Summary Statistics의 N은 이런 문제를 빠르게 발견하는 데 유용합니다.

Expected N과 Observed N을 비교해야 하는 이유

Analysis Plan에서 200명이 예상되는데 Output에서:

N = 180

이라면 20명이 왜 제외되었는지 확인해야 합니다.

가능한 이유:

  • Missing Response
  • Filter
  • Eligibility Rule
  • Data Transfer 문제

등입니다.

따라서 Statistical Result를 해석하기 전에 Analysis Population이 맞는지 확인해야 합니다.

Summary Statistics Task와 Distribution Analysis Task는 어떻게 다를까?

둘 다 Data를 탐색하지만 초점이 다릅니다.

Summary Statistics Task

Numeric Summary 중심

예:

  • Mean
  • SD
  • Min
  • Max
  • Quartile

Distribution Analysis Task

Distribution Shape와 Graph까지 확장

예:

  • Histogram
  • Box Plot
  • Probability Plot
  • Skewness
  • Kurtosis

즉 Summary Statistics는 Data의 기본 Profile을 빠르게 만들고 Distribution Analysis는 Shape를 더 깊이 확인한다고 이해할 수 있습니다.

Summary Statistics만으로 Distribution을 완전히 알 수 있을까?

아닙니다.

예를 들어 Mean, SD, Min, Max가 동일한 두 Dataset도 Distribution Shape가 다를 수 있습니다.

따라서 Summary Table에서 이상한 Pattern이 보이거나 Statistical Model Assumption이 중요하다면 Graphical Analysis를 추가해야 합니다.

Summary Statistics는 Distribution의 압축된 정보이지 Distribution 자체는 아닙니다.

Summary Statistics와 Histogram을 함께 보는 이유

예를 들어:

Mean = 50

SD = 10

이라고 가정해보겠습니다.

Histogram을 보면 실제 Distribution이:

Pattern A

Bell-Shaped

일 수도 있고,

Pattern B

Two Peaks

일 수도 있습니다.

숫자만으로는 이 차이를 알기 어렵습니다.

따라서 Numeric Summary와 Visualization을 함께 사용하는 것이 중요합니다.

Summary Statistics와 Box Plot의 관계

Summary Statistics의:

  • Q1
  • Median
  • Q3

는 Box Plot의 핵심 구조가 됩니다.

따라서 Table에서 Quartile을 확인하고 Box Plot을 보면 같은 Distribution 정보를 숫자와 그림으로 연결해서 이해할 수 있습니다.

SAS Task를 사용하면 통계지식이 필요 없을까?

아닙니다.

Task는 계산을 쉽게 해줄 뿐 어떤 Statistic이 의미 있는지를 결정하지 않습니다.

예를 들어:

Nominal Variable의 Mean

을 출력할 수 있다고 해도 그 값이 의미 없을 수 있습니다.

따라서 분석자는 다음을 알아야 합니다.

  • Measurement Scale
  • Distribution
  • Research Question
  • Statistic Interpretation

Task에서 기본적으로 선택된 Statistic을 그대로 사용해도 될까?

기본 Option은 편리한 Starting Point일 수 있습니다.

하지만 분석 목적에 따라 조정해야 합니다.

예를 들어 Skewed Data라면 Mean과 SD뿐 아니라:

  • Median
  • Q1
  • Q3

를 추가하는 것이 좋을 수 있습니다.

즉 Default Output을 Statistical Judgment의 대체물로 생각하면 안 됩니다.

GUI 결과만 저장하면 재현성이 충분할까?

결과뿐 아니라 Task 설정과 Generated Code를 함께 관리하면 분석을 더 쉽게 재현할 수 있습니다.

앞선 글에서 살펴본 것처럼 Task는 SAS Code로 변환되어 실행됩니다.

따라서:

Input Data

Task Settings

Generated Code

Result

를 함께 이해하면 Reproducibility가 높아집니다.

Generated Code를 확인하면 무엇을 알 수 있을까?

예를 들어 Summary Statistics Task가 어떤 SAS Procedure를 사용하고 어떤 Variable과 Option을 지정했는지 확인할 수 있습니다.

이를 통해:

  • Analysis Variable
  • Grouping Variable
  • Selected Statistics

가 실제 Code에 어떻게 반영되는지 볼 수 있습니다.

GUI에서 선택한 옵션과 실제 실행 Logic을 연결해서 이해하는 데 도움이 됩니다.

같은 Task라도 Variable을 바꾸면 Code도 달라질까?

그렇습니다.

예를 들어 Analysis Variable이:

SATScore

에서:

BodyTemp

로 바뀌면 실행 Code에서도 대상 Variable이 달라집니다.

Classification Variable이나 Statistic Option을 추가해도 Code가 달라질 수 있습니다.

즉 Task는 고정된 Program이 아니라 사용자의 설정을 Code로 변환하는 Template 구조에 가깝습니다.

Summary Statistics Task는 반복 분석에 왜 유용할까?

한 번 Task를 구성한 뒤 Dataset이 Update되면 같은 구조로 다시 실행할 수 있습니다.

예를 들어 매주 새로운 Data가 들어오는 경우:

Updated Dataset

같은 Summary Task 실행

Mean / SD / N 비교

Data Trend 확인

이 가능합니다.

이는 Data Monitoring과 QC에도 유용합니다.

반복 분석에서 무엇을 비교할 수 있을까?

Version별로 다음 Statistic을 비교할 수 있습니다.

  • N
  • Missing
  • Mean
  • SD
  • Min
  • Max

예를 들어:

Version 1

N = 500

Mean = 70

SD = 8

Version 2

N = 550

Mean = 140

SD = 90

이라면 단순 Data 증가 이상의 변화가 발생했을 수 있습니다.

Unit 또는 Coding 문제를 확인해야 할 수도 있습니다.

Data Update 후 Min/Max를 다시 보는 이유

새 Observation 하나가 극단적인 값을 가지면 Mean과 SD가 크게 변할 수 있습니다.

따라서 Dataset Update 후에도 Summary Statistics를 다시 실행하는 것이 좋습니다.

특히 Final Analysis 전에는 최신 Analysis Dataset 기준 Summary를 재확인하는 것이 중요합니다.

Derived Variable도 Summary Statistics로 점검할 수 있다

예를 들어:

Change = Follow-up – Baseline

이라는 Derived Variable을 생성했다고 가정해보겠습니다.

Summary Statistics에서:

  • Mean Change
  • Median Change
  • Min Change
  • Max Change

를 확인하면 Derivation이 합리적으로 수행되었는지 검토할 수 있습니다.

Percentage Change는 특히 조심해야 한다

Percentage Change가:

(Change / Baseline) × 100

으로 계산된다면 Baseline이 0에 가까운 Observation에서 매우 큰 값이 만들어질 수 있습니다.

Summary Statistics에서:

Maximum = 10000%

같은 값이 나타난다면 Formula와 Baseline Data를 확인해야 합니다.

즉 Summary Statistics는 Derived Variable QC에도 매우 유용합니다.

Change Score에서 Mean의 방향도 확인해야 한다

예를 들어 Mean Change = -5라고 가정해보겠습니다.

-5가 Improvement인지 Worsening인지는 Scale Direction에 따라 다릅니다.

따라서 Task Output의 숫자만 보는 것이 아니라 Variable Definition을 함께 확인해야 합니다.

Classification Variable의 Category Coding도 확인해야 한다

예를 들어 Treatment가:

0 = Placebo

1 = Drug

인데 실제 Dataset에서:

2

가 존재한다면 Group Summary에 예상하지 못한 Category가 나타날 수 있습니다.

이는 Coding Error를 발견하는 신호일 수 있습니다.

따라서 Classification Variable의 Level도 반드시 확인해야 합니다.

Category Label이 없으면 결과를 오해할 수 있다

Treatment가 숫자 0/1로만 표시되면 Reviewer가 어떤 Group인지 알기 어렵습니다.

Format을 이용해:

0 → Placebo

1 → Drug

처럼 Label을 표시하면 Output Interpretation이 쉬워집니다.

즉 Summary Statistics의 품질은 계산뿐 아니라 Variable Metadata와 Format에도 영향을 받습니다.

같은 숫자를 가진 다른 Variable을 혼동하지 않으려면?

Variable Name과 Label을 명확하게 관리하는 것이 중요합니다.

예를 들어:

WT

보다:

Body Weight (kg)

라는 Label이 Output에 표시되면 의미가 훨씬 명확합니다.

특히 Summary Table을 다른 Reviewer와 공유할 때 Metadata가 중요합니다.

SAS Output을 보고 바로 보고서에 붙여도 될까?

먼저 Validation이 필요합니다.

최소한 다음을 확인하는 것이 좋습니다.

  • Correct Dataset인가?
  • Correct Variable인가?
  • Correct Unit인가?
  • Correct Population인가?
  • Missing 처리 방식은 맞는가?
  • Grouping은 맞는가?

이 확인 없이 Output을 그대로 Report에 붙이면 분석 오류를 놓칠 수 있습니다.

Summary Statistics는 QC Table과 어떻게 연결될까?

분석용 Dataset이 완성되면 Variable별 Summary를 자동으로 생성해 QC Table로 사용할 수 있습니다.

예:

VariableNMeanSDMinMax
Age100068.47.15090
Weight99571.29.542130
Score95024.15.3540

이 Table에서 이상한 값이 보이면 상세 Data Review로 연결할 수 있습니다.

Summary Statistics Task와 자동화는 어떤 관계일까?

GUI 기반 Task는 반복 작업의 출발점이 될 수 있습니다.

처음에는 GUI로 Analysis Logic을 구성한 뒤 Generated Code를 확인하여 필요하면 Program 형태로 확장할 수 있습니다.

예를 들어 여러 Dataset에 동일한 Summary를 반복해야 한다면 SAS Code를 자동화하는 것이 더 효율적일 수 있습니다.

즉:

Task

분석 구조 학습

Generated Code 확인

반복 분석 자동화

로 발전할 수 있습니다.

GUI Task만 계속 사용하는 것이 나쁠까?

아닙니다.

일회성 또는 반복 빈도가 낮은 분석에서는 GUI Task가 매우 효율적일 수 있습니다.

중요한 것은:

  • 어떤 Statistic을 생성했는지
  • 어떤 Data를 사용했는지
  • 어떤 Option이 설정되었는지

를 이해하는 것입니다.

GUI 사용 자체가 문제라기보다 결과의 Logic을 모르는 것이 문제입니다.

Summary Statistics Task의 진짜 역할

초보자에게는:

Mean을 계산하는 메뉴

처럼 보일 수 있습니다.

하지만 실제 분석에서는 다음 역할을 가집니다.

Data Understanding

중심과 산포 확인

Data Quality Review

Min / Max / N 확인

Group Comparison 준비

Classification Summary

Inferential Analysis 준비

t-Test / ANOVA 전 확인

Reproducibility

Task + Code 관리

즉 매우 기본적인 Task이지만 이후 Statistical Workflow 전체와 연결됩니다.

Summary Statistics에서 이상한 결과를 발견했을 때의 순서

예를 들어 Mean이 예상과 크게 다르다면 다음처럼 접근할 수 있습니다.

1. Analysis Variable 확인

잘못된 Variable을 선택하지 않았는가?

2. N 확인

Missing이나 Filter가 있는가?

3. Min / Max 확인

Extreme Value가 있는가?

4. Unit 확인

kg / lb 등 혼합되지 않았는가?

5. Median 확인

Skewness 가능성은?

6. Distribution Plot 확인

실제 Shape는?

7. Source Data 확인

Data Error인가?

이 흐름을 따르면 단순히 Task를 재실행하는 것보다 문제를 체계적으로 찾을 수 있습니다.

Summary Statistics와 Statistical Judgment

Task는 다음을 계산할 수 있습니다.

Mean = 100

SD = 50

Median = 60

Maximum = 1000

하지만 이 결과에서:

“Right-Skewed일 가능성이 있으므로 Distribution을 확인해야겠다.”

라고 판단하는 것은 분석자의 역할입니다.

즉 Software는 Statistic을 생성하고 Analyst는 Statistic에 의미를 부여합니다.

통계 Software의 Output이 분석의 끝이 아니라 Interpretation의 시작입니다.

Summary Statistics Task의 전체 구조

지금까지 내용을 하나로 연결하면 다음과 같습니다.

SAS Dataset

예: TESTSCORES

Analysis Variable

SATScore

필요 시:

Classification Variable

Gender / Treatment / Brand 등

Statistics Options

Mean

SD

Min

Max

Median

Quartile

Run

Generated SAS Code

SAS Execution

Summary Result

N 확인

Center 확인

Spread 확인

Range 확인

Distribution 의심 Pattern 확인

필요 시:

Distribution Analysis / Inferential Analysis

로 확장

첨부 교재에서도 Summary Statistics Task를 Descriptive Statistics를 생성하는 기능으로 소개하고, TESTSCORES의 SATScore를 대상으로 Task를 실행하도록 구성합니다.

흔한 오해 정리

“Summary Statistics Task는 Mean만 계산한다”

아닙니다.

Standard Deviation, Minimum, Maximum, Quartile 등 다양한 Descriptive Statistic을 생성할 수 있습니다.

“Numeric Variable이면 모두 Mean을 계산해도 된다”

아닙니다.

Nominal Code나 ID처럼 Arithmetic Meaning이 없는 Variable이 있을 수 있습니다.

“Classification Variable은 분석할 Numeric Variable이다”

아닙니다.

Classification Variable은 Data를 Group으로 나누는 역할을 합니다.

“Group Mean이 다르면 Statistical Significance가 확인된 것이다”

아닙니다.

Summary Statistics는 Descriptive Result입니다. Population Difference를 검정하려면 t-Test나 ANOVA 등이 필요합니다.

“Mean이 정상적으로 나오면 Data도 정상이다”

아닙니다.

Min/Max, SD, Median, Missing 등을 함께 확인해야 합니다.

“Task를 실행했으므로 올바른 Statistic이 선택된 것이다”

아닙니다.

Statistic 선택의 적절성은 Measurement Scale과 Distribution에 따라 Analyst가 판단해야 합니다.

“Summary Statistics만 보면 Distribution 전체를 알 수 있다”

아닙니다.

Histogram이나 Box Plot 같은 Visualization이 추가로 필요할 수 있습니다.

“기존 Task는 다시 수정할 수 없다”

아닙니다.

첨부 교재에서도 기존 Summary Statistics Task를 수정하여 추가 분석을 수행하도록 안내합니다.

“SAS Output의 N은 항상 Dataset 전체 N과 같다”

아닙니다.

Missing이나 Filter 때문에 Variable별 Analysis N이 달라질 수 있습니다.

“GUI Task를 사용하면 SAS Code를 알 필요가 없다”

Task 사용 자체는 가능하지만 Generated Code를 확인하면 실제 실행 Logic과 Reproducibility를 더 잘 이해할 수 있습니다.

Summary Statistics Task를 어떻게 기억하면 쉬울까?

다음 네 가지 질문으로 기억하면 됩니다.

1. 무엇을 요약할 것인가?

Analysis Variable

2. 어떤 Group별로 볼 것인가?

Classification Variable

3. 어떤 정보를 보고 싶은가?

Statistics

Mean / SD / Min / Max / Quartile

4. 결과에서 무엇을 확인할 것인가?

N + Center + Spread + Range + Distribution Signal

입니다.

전체적으로:

Variable

Group

Statistic

Interpretation

순서입니다.

왜 Summary Statistics Task를 이해해야 할까?

앞으로 진행할 Inferential Statistics의 대부분이 Sample Summary에서 시작하기 때문입니다.

예를 들어:

Confidence Interval

Sample Mean + Standard Error

t-Test

Group Mean + Variability

ANOVA

Group Mean + Within-Group Variation

Regression

Variable Distribution + Relationship

따라서 Summary Statistics는 단순한 예비 분석이 아니라 이후 Statistical Model의 입력 Data를 이해하는 핵심 단계입니다.

핵심 정리

Summary Statistics Task는 SAS Enterprise Guide에서 Descriptive Statistics를 생성하기 위한 기본 Task입니다.

첨부 교재에서도 이 Task를 Data의 Descriptive Statistics를 생성하는 기능으로 정의합니다.

대표적인 구조는 다음과 같습니다.

Input Dataset

Analysis Variable

예: SATScore

필요 시:

Classification Variable

Group별 Summary

Statistic 선택

Mean

Standard Deviation

Minimum

Maximum

Median

Quartile

Run

SAS Code 실행

Result

첨부 교재에서는 TESTSCORES Dataset의 SATScore를 대상으로 Summary Statistics Task를 사용하도록 안내하고 있습니다.

NormTemp Exercise에서는 Summary Statistics Task를 이용해 BodyTemp의 Mean, Standard Deviation, Interquartile Range를 확인하도록 구성합니다.

Summary Statistics의 가장 중요한 목적은 숫자를 많이 출력하는 것이 아닙니다.

다음 질문에 답하는 것입니다.

Data가 몇 개인가?

N

어디에 위치하는가?

Mean / Median

얼마나 퍼져 있는가?

SD / IQR

전체 범위는 정상적인가?

Min / Max

추가 Distribution Review가 필요한가?

Mean vs Median / Extreme Value 확인

Summary Statistics Task는 SAS 분석의 결과를 만드는 첫 번째 도구이면서 동시에, 본격적인 Statistical Model을 실행하기 전에 Data가 분석할 준비가 되어 있는지를 점검하는 진단 도구입니다.

Task를 통해 Statistic을 생성하는 것보다 더 중요한 것은 왜 그 Statistic을 선택했고, Result가 Data의 어떤 특성을 보여주는지를 이해하는 것입니다.

함께 읽으면 좋은 글

  • Descriptive Statistics의 목적: 본격적인 분석 전에 데이터를 진단해야 하는 이유
  • Mean·Median·Mode의 차이: 데이터 분포에 따라 중심값을 선택하는 기준
  • Variance와 Standard Deviation의 의미: 평균만으로 데이터 변동성을 설명할 수 없는 이유
  • Distribution을 먼저 확인해야 하는 이유: 데이터의 위치·산포·형태를 점검하는 과정
  • Descriptive와 Inferential Statistics의 차이: 표본 분석에서 모집단 추론으로 확장하는 과정

참고한 자료

  • SAS Enterprise Guide: ANOVA, Regression, and Logistic Regression Course Notes
  • Chapter 2 Introduction to Statistics
  • Fundamental Statistical Concepts
  • The Summary Statistics Task
  • TESTSCORES Data Set
  • NORMTEMP Exercises
  • Two-Way ANOVA Preparation

dlgkswn111
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

error: Content is protected !!

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.