효과 크기
효과 크기
- 효과 크기(Effect Size)는 통계적 유의 여부와 관계없이 관찰된 차이나 관계의 크기를 나타내는 지표
- 원자료의 단위가 다르면 차이의 크기를 직접 비교하기 어려움
- 효과 크기는 원자료 단위가 아니라 통계적인 기준과 비교하여 크기를 나타냄
- 대표적인 접근
- 분산을 이용하는 방법
- 평균 차이를 이용하는 방법
에타 제곱
- 에타 제곱(eta squared, η2)은 분산을 이용한 효과 크기 표현 방법
- 전체 변동 중에서 처치 또는 집단 차이로 설명되는 비율을 나타냄
- 전체 SS
- (X−전체평균)2의 합계
- 처치 SS
- ∑jnj(집단평균j−전체평균)2
- nj는 각 집단의 표본 크기
- SS는 편차제곱합(Sum of Squares)을 의미
import pingouin as pg
type_container = df_ship.query('ship_type == "Container"')["speed"]
type_tanker = df_ship.query('ship_type == "Tanker"')["speed"]
pg.compute_effsize(type_container, type_tanker, eftype="eta_square")
# 0.0316
compute_effsize는 먼저 Cohen's d를 계산한 뒤 에타 제곱으로 변환- 따라서 위 SS 정의로 직접 계산한 값과 다를 수 있음
에타 제곱 = 1
- 에타 제곱이 1이면 집단 간 차이만 있고 집단 내 차이는 없음
- 실험 조건에 따라 모든 것이 달라짐
- 같은 실험 조건이면 결과도 같음
- 예
- 대조군 데이터: 1, 1, 1
- 실험군 데이터: 3, 3, 3
에타 제곱 = 0
- 에타 제곱이 0이면 집단 간 차이는 없고 집단 내 차이만 있음
- 실험 조건에 따라 아무 것도 달라지지 않음
- 같은 실험 조건에도 서로 다름
- 예
- 대조군 데이터: 1, 2, 3
- 실험군 데이터: 1, 2, 3
코헨의 d
- 코헨의 d(Cohen's d)는 두 집단의 평균 차이를 합동 표준편차로 나눈 것
- 표준편차를 잣대로 평균 차이의 크기를 알기 쉽게 나타냄
pg.compute_effsize(type_container, type_tanker, eftype="cohen")
# 0.3616
-
Container와 Tanker의 평균 속도 차이는 합동 표준편차의 약 0.36배
-
파생 지표
- 글래스의 델타(Glass' Δ): 대조군(control group)의 표준편차를 사용
- 헷지스의 g(Hedges' g): 작은 표본에서 나타나는 코헨의 d의 편향을 보정
pg.compute_effsize(type_container, type_tanker, eftype="hedges")
Common Language Effect Size
- Common Language Effect Size(CLES)는 두 집단에서 무작위로 값을 하나씩 뽑았을 때의 해석을 제공
- A, B 두 집단에서 값을 하나씩 뽑았을 때 P(A>B)+0.5P(A=B)
- 동률은 양쪽에 절반씩 반영
pg.compute_effsize(type_container, type_tanker, eftype="cles")
# 0.6332
- Container가 더 빠른 비교에 동률의 절반을 더한 비율은 약 63.3%
기타 효과 크기
- Phi(ϕ) coefficient
- 범위: -1~+1
- 2x2 분할표에서 두 변수의 관계를 나타냄
- Matthews correlation coefficient와 같음
- Cramer's V
- ϕ를 일반화하여 범주가 3개 이상인 경우에 사용할 수 있게 한 것
- 범위: 0~1
- Rank-Biserial Correlation(RBC)
- 순위(rank)와 집단의 상관관계
- 범위: -1 ~ +1
퀴즈
효과 크기(effect size)에 대한 설명으로 가장 적절한 것은?
퀴즈를 풀려면 대화형 기능을 불러와야 합니다.