통계학의 분석기법들은 크게 모수적 분석과 비모수적 분석 방법으로 나눠집니다.
1. 모수 검정(parametric test)
모수 검정이란 모집단이 특정한 분포를 따른다는 가정하에서 모수에 대한 검정을 뜻합니다.
모수란 표본을 대상으로 도출된 통계량(평균, 표준편차, 분산)을 통해 모집단의 특성을 유추하게 되는데 이를
모수( 모-평균, 모-표준편차, 모-분산 )라고 합니다. 즉, 모집단을 설명하기 위한 여러가지 지표를 말합니다.
1-1 모수 검정의 가정
모수 검정을 진행하기 위해서는 4가지 가정이 필요합니다.
이가정 들이 충족되지 않는다면 모수적 방법의 결과의 신뢰도가 낮아집니다.
가. 정규성
모수 검정의 대부분은 데이터가 정규분포를 따라야한다는 가정입니다.
정규성 검정의 가설
귀무가설(H0) : 데이터가 정규분포를 따른다.
대립가설(H0) : 데이터가 정규분포를 따르지 않는다.
데이터가 정규분포를 따르는지 확인하기 위한 검정법은 아래와 같습니다.
| 검정방법 | Python 라이브러리 | 장 단점 | 비고 |
| Q-Q Plot | statsmodels.api.qqplot | 시각적으로만 확인이 가능하다. | 직선의 형태일 수록 정규성을가진다. |
| Shapiro-Wilks | scipy.stats.shapiro | pvalue값을 확인 가능하다. 데이터 크기가 크면 정확도가 낮아진다. 이상치에 민감하다. |
pvlaue > 0.05일때 귀무 가설(데이터가 정규성을 가진다.)을 채택한다. |
| Anderson-Darling | scipy.stats.Anderson | 데이터가 5000개 이상일때 Shapiro-Wilks대신해서 사용한다. | 유의확률과 pavlue가 함께 출력된다. |
나. 독립성
각 관측치는 서로 독립적이여야 합니다. 즉, 다른 관측치에 영향을 미치면 안된다는 가정입니다.
독립성 검정의 가설
귀무가설(H0) : 데이터가 독립적이다.
대립가설(H0) : 데이터가 독립적이지 않다.
데이터가 독립적인지 확인하는 검정법은 아래와 같습니다.
| 검정방법 | Python 라이브러리 | 장 단점 | 비고 |
| 피어슨 상관계수 | scipy.stats.pearsonr | 선형적 관계만 측정하므로 비선형적 관계를 감지하지 못한다. | 상관계수가 0에 가까운지 확인한다. |
| 카이제곱 독립성 검정 | scipy.stats.chi2_contingency | 변수가 2개 이상의 범주로 분할 되어있을때 사용한다. | p-value가 유의 수준보다 크면 두 변수는 독립적이라는 귀무 가설을 기각하지 않는다. |
다. 등분산성
두 개 이상의 그룹을 비교할 때, 각 그룹의 분산이 동일하다는 가정입니다.
등분산성 검정의 가설
귀무가설(H0) : 데이터의 분산이 동일하다.
대립가설(H0) : 데이터 의 분산이 동일하지 않다.
데이터의 등분산성을 확인하는 검정법은 아래와 같습니다.
| 검정방법 | Python 라이브러리 | 장 단점 | 비고 |
| Levene 검정 | scipy.stats.levene | 데이터의 중앙값을 기준으로 하므로, 데이터가 정규 분포를 따르지 않는 경우에도 잘 작동한다. | p-value가 유의 수준보다 크면 데이터의 분산이 동일하다. |
| Bartlett의 검정 | scipy.stats.bartlett | 데이터가 정규 분포를 따른다는 가정 하에 분산의 동일성을 검정한다. 비 정규성에 민감하다. |
p-value가 유의 수준보다 크면 데이터의 분산이 동일하다. |
| Fligner-Killeen 검정 | scipy.stats.fligner | 데이터의 중앙값을 기준으로 하므로, 데이터가 정규 분포를 따르지 않는 경우에도 잘 작동한다. | p-value가 유의 수준보다 크면 데이터의 분산이 동일하다. |
라. 등간 척도 또는 비율 척도
변인(변수)은 등간척도나 비율척도로 측정되어야 한다는 가정입니다.
이는 등간척도 혹은 비율척도가 산술연산이 가능하기 때문에 상대적 크기 차이나 간격 차이를 측정할 수있기 때문입니다.
위의 가정들이 충족되지 못한다면 비모수 검정을 사용합니다.
2. 비모수 검정(Non-parametric test)
비모수 검정이란 모수에 대한 가정을 전제로 하지 않고, 모집단의 형태와 관계없이 순위나 부호와 같은 비모수적인 방법을 사용하여 통계적 가설을 검정하는 방법입니다.
2-1 비모수 검정의 특징
가. 분포 가정의 필요성이 없음
비모수 검정은 모집단의 분포에 대한 가정을 하지 않기 때문에, 데이터가 정규 분포를 따르지 않는 경우에도 적용할 수 있습니다.
나. 데이터의 척도에 제한이 없음
비모수 검정은 명목척도나 서열척도와 같은 순서나 간격에 의미를 부여하는 척도로 측정된 데이터에도 적용할 수 있습니다.
다. 상대적으로 덜 강력하지만 유연함
비모수 검정은 모수 검정보다는 상대적으로 강력하지 않을 수 있으나, 특정 상황에서는 유연성과 간편성을 제공합니다.
3. 모수, 비모수검정별 대응되는 방법론
| 모수 검정 | 비모수 검정 | 목적 | 예시 |
| t-검정 (one-sample t-test) |
부호 검정 (sign test), 윌콕슨 부호 순위 검정 (wilcoxon signed rank test) |
샘플 데이터의 평균이 특정 값과 다른지를 검정 | 수우 전 후 영아 체중 비교 |
| 이표본 t-검정 (two sample t-test or 독립 t-검정) |
윌콕슨 순위합 검정 (wilcoxon rank sum test) |
두 개의 독립적인 표본 그룹의 평균이 통계적으로 동일한지를 판단하기 위해 사용 | 남성과 여성 간의 평균 키 차이 |
| 대응 표본 t-검정 (paried t-test) |
A와B의 차이에 대한 부호 검정 (sign test), 윌콕슨 부호 순위 검정 (wilcoxon signed rank test) |
두 관련 표본 간의 평균(모수검정) 혹은 중앙값(비모수 검정)의 차이를 검정하기 위해 사용 | 신약을 복용하기 전과 복용한 후의 건강 지표를 비교 |
| 일원 분산분석 (one-way ANOVA) |
크러스칼-윌리스 검정 (Kruskal-Wllis test) |
세 집단 이상의 표본간 비교 | 세 가지 다른 교육 방법을 적용하여 학생들의 시험 성적을 비교 |
'통계 분석' 카테고리의 다른 글
| [표본 통계량의 분포] t분포 (1) | 2023.10.31 |
|---|---|
| [Python] 정규성 검정 (0) | 2023.10.28 |
| [기초 통계학] 회귀분석의 종류(1) (0) | 2023.06.30 |
| [기초 통계학] 회귀 분석 (1) | 2023.06.29 |
| [기초 통계학] 통계학 및 로마자 기호 모음 (0) | 2023.06.28 |