logo

표집 오차

표집 오차

  • 표집 오차(Sampling Error): 모집단 전체가 아닌 표본만 관찰하기 때문에 표본에서 계산한 통계량과 모집단의 모수 사이에 생기는 차이
  • 표집 오차는 다음과 같이 나타낼 수 있음
    • 표집 오차 = 통계량 - 모수
    • 예: 표본평균 - 모평균, 표본비율 - 모비율
  • 무작위로 표본을 추출하더라도 어떤 관측치가 뽑히느냐에 따라 통계량이 달라지므로 표집 오차가 발생함
  • 표집 오차는 조사 실수나 표본 추출의 편향과는 다른 개념

표본 크기와 표집 오차

  • 표본의 크기가 커질수록 통계량의 표집분포는 일반적으로 좁아짐
  • 따라서 큰 표본에서는 큰 표집 오차가 발생할 가능성이 작아지는 경향이 있음
  • 다만 표본 크기를 키워도 표집 오차를 완전히 없앨 수는 없음
  • 표본의 크기가 크더라도 추출 방법이 편향되어 있으면 모집단을 제대로 대표하지 못할 수 있음

표집 오차의 예시

  • 6면체 주사위 눈의 모집단 평균은 3.5
  • 주사위를 10번 굴려 눈의 합이 26이었다면 표본평균은 2.6
  • 이 표본평균의 표집 오차는 다음과 같음
2.63.5=0.9
  • 음의 표집 오차는 표본에서 계산한 값이 모수보다 작게 나왔다는 뜻

10d6 주사위 표집 오차 예시

비표집 오차

  • 비표집 오차(Non-sampling Error): 표본 추출의 무작위성 이외에 조사 설계, 자료 수집, 처리, 분석 단계에서 발생하는 오류
  • 주요 원인
    • 조사 설계: 편향된 질문, 모호한 개념 정의
    • 자료 수집: 무응답, 부정확한 응답, 조사자의 유도
    • 자료 처리: 데이터 입력 실수, 부적절한 분석 방법
  • 비표집 오차는 표본 크기를 키운다고 자동으로 줄어들지 않음
  • 전수 조사에서도 측정이나 입력 과정에 문제가 있으면 비표집 오차가 발생할 수 있음

표집 오차와 비표집 오차 비교

구분 표집 오차 비표집 오차
발생 원인 모집단의 일부만 무작위로 관찰 설계, 측정, 응답, 처리, 분석의 문제
표본 크기의 영향 커질수록 일반적으로 감소 커진다고 자동으로 감소하지 않음
전수 조사에서 발생 여부 발생하지 않음 발생할 수 있음
표본평균과 모평균의 우연한 차이 유도 질문, 무응답, 입력 오류

시뮬레이션: 표본 추출과 표집 오차 확인

import numpy as np

# 모집단의 평균과 표준편차 (모수)
pop_mean = 170
pop_sd = 10

# 같은 코드를 실행할 때 같은 난수가 생성되도록 설정
rng = np.random.default_rng(2026)

# 모집단 분포에서 100건을 무작위 추출 (표본)
sample = rng.normal(loc=pop_mean, scale=pop_sd, size=100)

# 표본평균 (통계량)과 표집 오차
sample_mean = sample.mean()
sampling_error = sample_mean - pop_mean

sample_mean, sampling_error
  • 난수 시드를 바꾸거나 시드 설정을 제거하고 코드를 다시 실행하면 표본과 표집 오차가 달라질 수 있음
  • size를 크게 바꾸어 여러 번 실행하면 표본 크기와 표집 오차의 관계를 확인할 수 있음

퀴즈

문제 1 / 6맞음: 0힌트: 0틀림: 0채점중: 0남음: 6

표집 오차에 대한 설명으로 가장 적절한 것은?

  • 표본에서 계산한 통계량과 모집단 모수 사이의 우연한 차이
  • 질문 문항이 특정 응답을 유도해서 생긴 체계적인 차이
  • 자료를 입력하면서 일부 값을 잘못 기록해 생긴 차이
  • 부적절한 분석 방법을 선택해 결론이 달라진 차이

퀴즈를 풀려면 대화형 기능을 불러와야 합니다.

Previous
추정