추 정

(Estimate)

 

이야기로 배우는 통계학 : 이해용. 이필용 공저, 자유아카데미, 2003, page 265~308

1. 통계적 추정

2. 점추정

   (1) 점추정의 선택 기준

   (2) 모수에 대한 점추정

3. 모평균에 대한 구간추정

   (1) σ 를 알고 표본이 큰 경우

   (2) σ 를 모르고 표본이 큰 경우

   (3) σ 를 모르고 표본이 작은 경우

4. 모비율에 대한 구간추정

5. 모분산에 대한 구간추정

6. 모평균과 모비율 차의 구간추정

   (1) 두 모평균 차의 구간추정

   (2) 두 모비율 차의 구간 추정

7. 표본크기 결정

   (1) μ 를 추정할 때 표본 크기

   (2) π 를 추정할 때 표본 크기

1. 통계적 추정

제 6 장까지는 모집단의 성격을 알고 있다는 전제 조건 아래에서 표본 통계량 특성에 관하여 설명하였다. 그러나 대부분 실제 상황에서 모집단의 성격은 알려져 있지 않다. 그러므로 표본에서 구한 통계량을 바탕으로 모수를 추정해야 한다. 모수에 대한 추측 이론이 통계적 추론인데 추정과 가설검정으로 구분한다.

이번 장에서는 통계적 추정에 대하여 설명하고자 한다. 관심의 대상이 되는 모집단 참값을 모수라 하는데 모수는 일반적으로 알려져 있지 않다. 그래서 모집단으로부터 표본을 추출하여 표본에서 구한 통계량을 기초로 모수를 추정하게 된다. 통계분석의 목적은 대부분 이러한 모수 즉 참값을 추정하는데 있다. 추정이란 '추측하여 판정한다' 는 뜻이다.

다음과 같은 예를 통하여 추정에 대한 개념을 살펴보자. 야구 방망이나 테니스 라켓 등의 손잡이 부분은 국민의 손 크기에 적합하도록 제작되어야 한다. 그리고 각종 생활용품을 비롯한 문구류도 국민 표준체위에 맞게 만들어져야 한다. 그러나 전체 국민에 대하여 성별 연령별 표준체위를 조사하는 것은 매우 곤란하고 비효율적이다. 그래서 성별 연령별로 표본을 추출하여 국민 체위 조사를 시행한다. 표본추출에 의한 「국민표준체위 조사」에 따르면 우리 국민 성인남녀의 한 뼘 길이는 각각 평균이 19.6 mm, 17.7 cm 이다. 따라서 우리나라 전체 성인남녀의 한 뼘 길이는 각각 평균이 19.6 cm 와 17.7 cm 로 추정할 수 있다.

이렇게 모집단의 모수를 표본으로부터 구한 통계량으로 추정하기 때문에 통계량을 또한 추정량 (estimator) 이라고 부른다. 모수를 하나의 값으로 추정하는 것을 점추정 (point estimate) 라고 한다. 한편 한국 성인 남성의 한 뼘 길이는 평균이 18.6 cm 에서 20.6 cm 일 것이라고 추정할 수 있다. 이와 같이 모수에 대하여 적절한 구간으로 추정하는 것을 구간추정 (interval estimate) 라고 한다. 또 다른 예를 들어 설명하도록 하자.

우리나라 대학생들의 데이트 약속 시간은 몇 시쯤일까 전체 대학생들을 모두 조사하는 것은 불가능하므로 대학생 1,000 명을 표본 추출하여 데이트 약속시간을 조사하였다고 하자. 조사결과에 의하면 데이트 약속시간은 평균이 오후 6 시이고 표준편차는 30 분이라고 한다. 이러한 결과로부터 우리나라 대학생들의 데이트 약속시간은 오후 6 시일 것이라고 추정하면 점추정이다. 왜냐하면 모수를 하나의 값으로 추정하기 때문이다. 한편 대학생들의 데이트 약속시간은 5 시 30 분에서 6 시 30 분일 것이라고 추정하면 구간추정이다. 왜냐하면 일정한 범위로서 모수가 포함될 수 있는 구간으로 추정하기 때문이다.

점추정이란 모수에 가장 접근하는 표본 추정치로서 하나의 값으로 표현한다. 그러므로 점추정에는 항상 오차가 있을 수 있다. 그러나 점추정에서는 오차가 어느 정도인지 알 수 없다. 그러므로 모수와 점추정치 간에 존재하는 오차가 생략될 수밖에 없다.

다시 말하면, 점추정에는 신뢰성 정도가 포함될 수 없는 단점이 있다. 그러나 구간추정의 경우에는 모수가 포함될 범위로서 추정하는 것이므로 신뢰성 정도를 포함하고 있다. 따라서 모수를 추정함에 있어서는 점추정 보다 구간추정을 더 많이 사용하는 까닭이 여기에 있다.

2. 점추정

모집단이 갖는 특정한 모수를 추정하는 데에는 여러 추정량이 있을 수 있다. 예를 들어 모집단의 대표치를 추정하고자 할 때 그 모집단으로부터 추출된 표본에서 산술평균, 중앙치, 최빈치를 구했을 때 어느 하나를 택할 수 있다. 그런데 어떠한 통계량을 추정치로 삼을 것인가?

당연히 모집단 평균에 가장 접근하는 표본 추정치를 택해야 한다. 그러나 모평균은 대부분 알려져 있지 않기 때문에 어떤 추정치가 가장 잘 접근하는지 알 수 없다. 그러므로 평균, 중앙치, 최빈치의 표본분포를 서로 비교해야 한다. 표본 통계량의 확률분포를 비교함으로서 어떠한 추정치가 모평균에 잘 접근하는지 또는 차이가 많이 나는지 알 수 있다. 다시 말하면 표준오차가 적은 통계량이 모평균에 보다 접근함을 알 수 있다.

(1) 점추정의 선택 기준

모집단으로부터 크기가 동일한 표본은 무수히 많이 추출할 수 있다. 만약 각각의 표본이 충분히 크기만 하면 표본 통계량은 중심극 한정리에 의하여 정규분포를 따른다. 그러므로 통계량을 모수에 대한 추정량으로 사용한다. 추정량을 선택함에 있어서 불편성 (unbiasedness), 효율성 (efficiency), 일치성 (consistency) 의 3 가지 기준을 고려해야 한다.

① 불편성

제 6 장에서 설명한 바와 같이 표본이 충분히 크기만 하면 표본 평균과 비율에 대한 확률분포는 정규분포한다. 따라서 표본 통계량의 기대치는 모수와 같다. 그러므로 다음과 같은 식이 성립한다.

어떤 집단으로부터 크기가 동일한 표본은 무수히 많이 추출할 수 있다. 그러면 각 표본에서 구해진 평균 비율 등은 일정한 값으로 나타나지 않고 변한다. 그러므로 표본 통계량은 확률변수라 할 수 있다. 표본에서 구한 추정량이 모수와 꼭 일치하지는 않지만 오차가 작아야 신뢰할 수 있는 추정량이라 할 수 있다. 만약 추정량이 모수와 크게 차이가 나면서 변화한다면 신뢰할 수 없다. 이제 어떤 통계량  의 확률분포가 그림 1 로 나타났다고 하자.

그림 1  편의추정량의 확률분포

그림 1 로 나타난 통계량  모수 (θ) 의 추정량으로 사용한다면 이러한 통계량은 신뢰성 있는 추정량이 될 수 없다. 왜냐하면 추정량의 기대치는 2θ 이기 때문이다. 추정치의 기대치가 모수에 대하여 2 배로 나타나므로 모수 (θ) 와 크게 차이를 보이고 있다. 이러한 추정량  은 신뢰할 수 없다. 이렇게 추정량의 기대치가 모수와 같지 않을 때 편의 (bias) 가 있다고 표현한다. 편의란 '추정량이 모수에 근접하지 않고 한쪽으로 기울어져 치우친 상태' 를 의미한다. 그림 1 에서 점선으로 나타난 것이 편의가 없는 추정량의 확률분포이다. 이렇게 편의가 없는 성질을 가리켜 불편성이라고 한다.

표본에서 구한 추정량의 기대치가 추정하고자 하는 모수와 같을 때 그 통계량을 불편추정량 (unbiased estimator) 이라 한다. 그림 1 에서 어떤 통계량의 확률분포가 점선과 같이 나타난다면, 그 통계량은 불편추정량이다. 왜냐하면 그 통계량의 기대치가 모수와 같기 때문이다. 이제 추정하려는 모수를 θ 로 표현하고 표본에서 구한 통계량을  로 나타낼 때 식 1 이 성립하면  를 불편추정량이라고 한다.

불편추정량 :

식 1

다시 말하면 불편추정량이란 편의가 없는 추정량이다. 편의가 없다는 뜻은 추정량이 모수에 대하여 큰 차이를 보이지 않고 어느 한쪽으로 치우침이 없다는 의미이다. 그러므로 불편추정량은 모수에 대하여 올바른 추정량이란 의미이다. 그렇다면 표본평균과 표본비율은 모평균과 모비율을 추정함에 있어서 불편추정량인가? 당연히 불편추정량이다. 왜냐하면 제 6 장에서 설명한 바와 같이 표본평균의 기대치는 모평균과 같고 표본비율의 기대치도 모비율과 같기 때문이다. 즉,  가 성립하기 때문에 표본평균은 모평균에 대하여 불편추정량이다. 또한 E(p) = π 가 성립하기 때문에 표본비율도 모비율에 대하여 불편추정량이다.

여기서 주의할 사항이 있다. 편의가 없는 불편추정량은 표본오차가 없는 추정량을 의미하는 것이 아니다. 이미 제 6 장에서 설명한 대로 표본오차란 표본을 추출하는 과정에서 발생하는 오차이다. 어떠한 표본이 표본오차가 없이 추출된 경우라도 표본 추정량의 기대치가 모수와 같지 않으면 편의가 발생된 것이다. 그러므로 편의와 표본오차를 구별해야 한다.

이제 제 2 장에 나타난 분산의 정의로부터 발생된 궁금증에 대하여 설명하도록 하자. 표본분산을  로 제 2 장 식 2 – 18 에서 정의한 바 있다. 왜 표본분산을 계산함에 있어서 표본크기 n 으로 나누지 않고 (n – 1) 로 나누어야 하는가? 제 2 장에서는 그 까닭을 상세히 밝히지 않았다. 표본분산은 편차의 제곱 합을 (n - 1) 로 나눈 것이다.

(n – 1) 로 나누어야 하는 까닭은 표본분산이 모분산을 추정함에 있어 불편추정량이 되기 위해서다. 편차의 제곱 합을 (n – 1) 로 나누어야 표본분산의 기대치가 모분산과 같아지기 때문이다. 즉, E(s2) = σ2 을 만족해야 표본분산 s2 이 모분산 σ2 의 불편추정량이 될 수 있다. 이제 (n – 1) 로 나눈 표본분산이 모분산의 불편추정량임을 증명하여 보자. E(s2) = σ2 가 성립하는 것을 증명이 되면 표본분산 s2 은 모분산 σ2 의 불편추정량임을 알 수 있다.

 은 상수이므로

 이므로

 는 상수이므로

 

,  이므로

,  이므로

따라서 E(s2) = σ2 이 성립하므로 표본분산  은 모분산 σ2 의 불편추정량이다. 그러므로 표본분산을 계산함에 있어서 편차의 제곱 합을 (n – 1) 로 나누어야 한다.

② 효율성

불편추정량이란 추정하고자 하는 모수에 대하여 편의가 없이 접근하는 추정량이란 의미이다. 그렇지만 불편추정량은 좋은 추정량이 되기 위한 필요조건이기는 하지만 충분조건은 아니다. 이제 두 종류 추정량  과  의 확률분포가 각각 그림 2 로 나타났다고 하자.

그림 2  두 불편추정량의 확률분포

그림 2 에서 그림 (A) 는 추정량  의 확률분포가 모수 θ 를 중심으로 좁게 밀집되어 있다. 따라서 추정량  는 모수로부터 크게 벗어날 가능성은 적다. 한편 그림 (B) 에서는 추정량  의 확률분포가 모수를 중심으로 넓게 흩어져 있다. 따라서 추정량  는 모수로부터 크게 차이가 날 가능성이 많다. 그러므로 추정량  가 추정량  보다 효율성 잇는 추정량이다. 왜냐하면 추정량  의 분산이 보다 적게 나타나기 때문에 표준오차가 적다. 다시 말하면 여러 종류 추정량이 있을 때 분산이 최소로 나타나는 추정량을 가리켜 효율성 있는 추정량이라 한다.

이제 어떤 모집단으로부터 추출된 표본에서 추정량으로 평균과 중앙치를 구하였다고 하자. 만약 모집단이 정규분포한다면 표본 중앙치의 분산은 (π/2)(σ2/n) 이다. 표본 중앙치의 분산은 표본 평균의 분산보다 π/2 배 만큼 더 크다. 즉, 표본 중앙치의 분산은 표본 평균의 분산보다 약 1.57 배 크다는 의미이다. 그러므로 표본평균이 표본 중앙치보다 효율성 있는 추정량이라고 할 수 있다. 따라서 모평균에 대한 추정량으로 표본 중앙치보다 표본평균이 더 중요하게 사용되는 까닭은 바로 효율성에 있다.

③ 일치성

표본 크기 n 이 증가함에 따라 통계량은 점차 모수에 접근하게 된다. 이렇게 표본 통계량이 모수와 같아질 때 그 통계량을 '일치 추정량' 이라 한다. 표본에서 구한 추정량이 불편성과 효율성이 있다면 보다 바람직한 추정량이 되기 위해서는 일치성이 있어야 한다. 이제 크기가 n 인 표본에서 구한 통계량을  라 하자. 아래와 같은 식 2 를 만족할 때 추정량  를 일치 추정량이라 한다.

일치 추정량 :

식 2

일치성이란 표본 크기가 클수록 추정량은 보아 신뢰성이 있다는 것을 뜻한다. 다시 설명하면 어떤 모집단으로부터 크기가 충분히 큰 표본을 추출했을 때 표본평균은 모평균에 일치 추정량이 될 수 있다. 그런데 표본평균의 표준오차는  이므로 표본 크기 n 이 매우 크면 상대적으로 표준오차는 0 에 접근하게 된다. 표준오차가 0 에 접근한다는 뜻은 표본평균이 모평균에 거의 일치한다는 의미이다. 만약 모집단이 정규분포라면 표본 중앙치는 표본 평균과 같으므로 중앙치 또한 일치 추정량이라 할 수 있다.

(2) 모수에 대한 점추정

앞에서 점추정치를 선택할 때 고려해야 할 기준에 대해서 설명하였다. 이러한 기준을 만족시키면서 모평균, 모비율, 모분산에 대한 점추정치로서 어떠한 추정량이 사용되는지 알아보자.

첫째, 모평균에 대한 점추정치로서 표본평균을 사용한다.

관심의 대상이 되는 전체 집단에서 모평균은 일반적으로 알려져 있지 않다. 그러므로 모평균에 대한 추정치로서 표본평균을 사용한다. 표본평균은 모평균에 대해서 불편추정량이고 모집단이 정규분포한다면 효율성이 있는 추정량이다. 또한 표본 크기가 충분히 크다면 일치성 있는 추정량이 될 수 있다. 이러한 이유 때문에 표본 평균은 모평균에 대하여 가장 적합한 추정량이다.

둘째, 모비율에 대한 점추정치로서 표본비율을 사용한다.

모집단에서 어떠한 특정 성격을 나타내는 모비율은 알려져 있지 않다. 그러므로 표본을 추출하여 표본에서 구한 표본비율을 모비율의 추정량으로 사용한다. 표본비율 또한 불편성 효율성 일치성 있는 추정량이다.

셋째, 모분산에 대한 점추정치로서 표본분산을 사용한다.

모집단에서 변화하는 정도를 나타내는 분산은 알려져 있지 않다. 그러므로 표본을 추출하여 표본에서 구한 표본분산을 모분산의 추정량으로 사용한다. 그러나 표본분산이 불편추정량이 되기 위해서는 편차의 제곱 합을 (n – 1) 로 나눈다. 이러한 표본분산은 다른 여러 종류의 분산도를 측량하는 단위보다 상대적으로 효율성과 일치성이 있기 때문에 모분산의 추정량으로 사용하게 된다.

이상으로 점추정에 대하여 설명하였다. 만약 표본에서 구한 통계량이 불편성, 효율성, 일치성의 3 가지 기준을 만족시킨다면 추정량으로서 별다른 문제는 발생되지 않는다. 그러나 어떤 추정량이 3 가지 기준을 모두를 만족시키지 못한다면 불편성을 만족시키는 추정량을 선택하는 것이 좋다.

3. 모평균에 대한 구간추정

앞 절에서 설명한 바와 같이 점추정치는 오차의 정도를 포함하고 있지 않다. 그래서 점추정치는 모수에 대하여 신뢰성 있는 추정량인지 알 수 없다. 그러므로 점추정보다 구간추정을 더 자주 사용하게 된다. 신뢰성 정도를 고려하여 모수가 포함될 일정한 범위로 추정하는 것이 구간추정이다. 그러면 통계량으로부터 모평균에 대한 구간추정이 어떻게 설정되는가 살펴보자. 먼저 모집단 표준편차 σ 가 알려져 있고 표본 크기가 충분히 큰 경우에 신뢰구간을 설명하기로 한다. 다음으로 보다 실제적인 경우로서 모표준편차 σ 가 알려져 있지 않은 경우에 구간추정을 설명하기로 한다.

(1) σ 를 알고 표본이 큰 경우

제 3 장 확률분포에서 확률변수 X 가 25 보다 클 확률은 P(X > 25) 로 표현하였다. 이제 확률변수 X 가 a 에서 b 사이에 값을 갖게 될 확률을 P(a < X < b) 로 표현하자.

그러면 표준화 변수 Z 가 -1.96 에서 +1.96 사이에 있을 확률은 P(-1.96 < Z < + 1.96) = 0.95 로 표현된다. 표본평균에 대한 표준화 변수는  이므로 표본평균이  에서  사이에 있을 확률은 95 % 로서  와 같이 표현된다. 이제 표본평균의 확률분포로부터 표준오차  는  이다. 그러므로 표본평균이 모평균과 관련하여 일정한 범위내에 있을 확률이 95 % 라는 표현식 3 과 같다.

표본평균 값이 갖는 확률 :

식 3

위에 식 3 은 표본평균이 모평균으로부터 1.96 배의 표준편차 이내로 값을 갖게될 확률이 0.95 라는 의미이다. 여기서 표준오차는 표본평균의 표준편차로서  이다. 제 6 장 표본평균의 확률분포에서 설명한 바와 같이 표본이 충분히 크기만 하면 표본평균은 그 기대치가 μ 이고 표준편차가  인 정규분포한다.

이러한 표본평균을 표준화 변수 Z 로 변환하면 표준화 변수 Z 의 값이 -1.96 에서 +1.96 사이에 나타날 확률은 0.95 이다. 따라서 식 3 은 표준정규분포로부터 유도된 식임을 알 수 있다. 그러므로 식 3 으로 표현된 표본평균이 갖는 값의 범위로부터 모평균에 대한 신뢰구간을 설정할 수 있다. 식 3 에서 { } 내에 있는 범위를 다시 정리하여 보자.

 , 각항에서 μ 를 뺀다.

 , 각항에서  를 뺀다.

 , 각항에서 -1 을 곱한다.

따라서 표본평균으로부터 모평균이 갖게 될 95 % 의 신뢰구간을 구하는 식을 구할 수 있다. 그러므로 95 % 의 신뢰수준으로 모평균에 대한 구간추정 범위는 식 4 와 같이 설정할 수 있다.

모평균에 대한 95 % 신뢰구간 :

식 4

식 4 는 모평균이 포함될 구간을 95 % 신뢰수준으로 추정한 것이다. 그러므로 식 4 로 표현된 모평균에 대한 구간추정을 신뢰구간 (confidence interval) 이라 부른다. 이것은 모평균이 갖게 될 구간을 95 % 수준으로 신뢰한다는 의미이다.

여기서 신뢰수준 정도를 나타내는 95 % 또는 0.95 를 신뢰계수 (confidence coefficient) 라 한다. 따라서 식 4 에서 신뢰계수는 0.95 이다. 신뢰수준을 나타내는 신뢰계수는 0.95 로 일정한 것은 아니다. 경우에 따라서 신뢰계수를 0.90 또는 0.99 로 설정할 수 있다. 신뢰계수를 0.99 로 설정한다는 의미는 신뢰성의 정도를 99 % 로 기준한다는 뜻이다. 마찬가지로 신뢰계수가 0.90 이라 함은 신뢰성 정도가 90 % 라는 뜻이다.

이러한 신뢰계수는 일반적으로 0.95 로 설정하는데 유의수준 (significance level) 이 0.05 라는 의미이다. 유의수준이라는 낱말은 가설검정에서 자주 사용되는데 그 뜻을 명확히 이해하여야 한다. 유의란 ‘의미가 있다’ 는 뜻이다. 표본을 추출하여 모평균에 대한 구간추정을 함에 있어서는 오차가 발생될 수 있다. 그때 발생되는 오차범위에 대하여 의미를 두어야 한다는 뜻이다. 그래서 유의란 오차가 허용되는 범위로 해석되기도 한다. 유의수준에 대한 보다 상세한 설명은 제 8 장 가설검정에서 다루도록 하자.

일반적으로 유의수준을 α 로 표현하면 신뢰계수는 (1 – α) 이다. 신뢰계수가 (1 – α) 일 때 모평균에 대한 신뢰구간을 구하는 식은 식 5 로 일반화될 수 있다.

신뢰계수가 (1 - α) 일 때 모평균에 대한 신뢰구간 :

 

식 5

식 5 에 나타나 있는  는 확률 α/2 를 초과하게 되는 표준화 변수 Z 값을 의미한다. 그러므로 유의수준 α 값이 변함에 따라  값도 변하게 된다. 유의수준 α 의 크기에 따라 표준정규분포에 의하여 결정되는  값은 식 6 으로 나타난다.

유의수준에 따른  값 :

 

(1) α = 0.10 인 경우      = 1.64

(2) α = 0.05 인 경우      = 1.96

(1) α = 0.01 인 경우      = 2.58

식 6

모평균에 대한 신뢰구간을 추정하기 위해서는 식 5 를 이용한다. 그런데 식 6 에 의하여 신뢰계수가 0.90 일 때  는 1.64 이고, 0.95 일 때  는 1.96 이다. 따라서 신뢰계수가 0.90 으로 설정되었을 때 모평균에 대한 신뢰구간은 식 7 로 나타난다.

신뢰계수가 0.90 일 때 모평균에 대한 신뢰구간 :

 

식 7

표본평균을 바탕으로 모평균에 대한 신뢰구간을 추정할 때에 신뢰 구간이 갖는 범위에는 몇 가지 특성이 있다.

첫째, 표본 크기가 일정한 경우에 신뢰계수가 크면 클수록 신뢰구간 폭은 증가한다.

신뢰계수가 0.90 인 경우에 신뢰구간 폭은  이다. 그리고 신뢰계수가 0.95 인 경우에 신뢰구간 폭은  이다. 따라서 신뢰성 정도를 높이기 위해서는 신뢰구간 폭은 넓게 추정된다는 것을 알 수 있다.

둘째, 신뢰계수와 모표준편차가 일정한 경우에 표본이 크면 클수록 신뢰구간의 폭은 감소한다.

신뢰계수가 0.95 인 경우에 신뢰구간의 폭은 표본평균으로부터  이다. 따라서 신뢰구간 폭은 표본 크기의 제곱근에 반비례한다. 즉, 표본이 크면 신뢰구간 폭은 적게 추정될 수 있다. 예제로부터 모평균에 대한 신뢰구간을 어떻게 추정하는지 살펴보자.

예제 1

말은 그 시대의 '사상과 의식' 을 비추는 거울이다. 그런데 말은 시간과 공간을 뛰어넘지 못한다. 그래서 말을 담는 그릇이 필요하여 글이 생겨난 것이다. 한글은 우리 겨레의 얼이 담긴 소중한 문화유산이다. 신토불이 우리 것인데도 우리 국민은 한글을 너무 어렵고 장황하게 쓴다. 책 가운데서 가장 재미없고 어려운 책이 대학교재이다. 문장이 너무 길고 어렵게 쓰여 있기 때문이다. 문장이 비대하여 우리 글의 '다이어트' 가 요구된다.

우리나라 대학교재 가운데서 64 권을 표본 추출하여 한 문장을 이루고 있는 글자 수를 조사하였다. 표본조사 결과에 의하면 한 문장은 평균 60 자로 되어 있다. 단, 전체 대학교재에서 한 문장을 이루는 글자 수의 표준편차는 32 자라고 한다. 그렇다면 우리나라에서 대학교재로 쓰이는 모든 책은 한 문장이 평균 몇 글자로 되어 있을까? 95 % 를 신뢰계수로 구간추정하라.

풀이 1

대학교재로 사용되는 모든 책에서 한 문장에 나타난 글자 수 평균을 추정하는 문제이다. 즉 95 % 신뢰계수로 모평균에 대하여 구간추정을 하는 문제이다. 그런데 모표준편차가 알려져 있으므로 식 5 를 이용하여 구할 수 있다. 모평균을 μ, 모표준편차를 σ, 표본평균을 , 표본 크기를 n 으로 나타내자.

1 – α = 0.95, σ = 32,  = 60, n = 64 이므로 모평균에 대한 신뢰구간은 다음과 같다.

= 60 – 1.96(4) < μ < 60 + 1.96(4)

= 60 – 7.8 < μ < 60 + 7.84

= 52.16 < μ < 67.84

따라서 95 % 를 신뢰계수로 할 때, 대학교재에서 한 문장을 이루는 평균 글자 수는 약 52 자에서 68 자 사이일 것이다.

(2) σ 를 모르고 표본이 큰 경우

실제 경우에서 모표준편차 σ 는 대부분 알려져 있지 않다. 모표준편차를 모르는 경우에 표본이 충분히 크면 모표준편차 대신에 표본표준편차 s 를 사용할 수 있다. 왜냐하면 표본 크기가 충분히 크면 표본표준편차는 모표준편차에 대하여 불편성, 효율성, 일치성이 있는 추정량이기 때문이다. 따라서 모평균에 대한 신뢰구간을 구하는 식 5 에서 σ 대신에 s 를 사용할 수 있다. 그러므로 σ 를 모를 때 모평균에 대한 신뢰구간 추정은 식 8 으로 구할 수 있다.

σ 를 모를 때 모평균에 대한 (1 – α) 의 신뢰구간 :

 

식 8

식 8 에서  는 유의수준에 따라 변하는 표준화 변수 값을 의미한다. 무한모집단에서 추출된 표본이거나 또는 복원추를 방법으로 표본이 추출되었을 때 식 8 을 이용할 수 있다.

만약 유한모집단에서 표본에 비하여 모집단이 그다지 크지 않는 경우라면 유한모집단 수정항으로 수정되어야 한다. 그리고 표본이 비복원추출로 뽑힌 경우에도 수정항으로 수정되어야 한다. 제 6 장 2 절에서 유한모집단 수정항을 (N – n)/(N – 1) 로 설명한 바 있다. 유한모집단에서 모평균에 대한 신뢰구간은 다음 식 9 에 의해서 구할 수 있다.

 

유한모집단 수정항이 적용될 때 모평균에 대한 신뢰구간 :

 

 

 

식 9

 

예제 2

대기오염이 심각한데 오염물질 중에서 60 % 는 자동차가 배출하는 것이라고 한다. 그러므로 대기오염의 주범은 자동차라 할 수 있는데, 특히 교통체증이 심한 도심지역은 공해배출이 더욱 심하다. 자동차가 시곡 80 km 로 달릴 때보다 서행하고 있을 때 최고 5 배 정도나 공해물질이 더 배출된다고 한다.

유연 휘발유 차량 100 대를 표본으로 추출하여 시속 10 km 로 천천히 달리는 실험을 하였다. 실험 결과에 의하면 km 당 내뿜는 일산화탄소량은 평균 56 g 이고 표준편차가 20 g 이다. 그렇다면 전체 유연휘발유를 사용하는 차량이 시속 10 km 로 서행할 때 km 당 내뿜는 일산화탄소량 평균은 얼마인지 90 % 를 신뢰계수로 구간추정하라.

풀이 2

표본 크기가 100 이므로 충분히 크다고 간주하여 식 8 을 이용한다. N = 100,  = 56,  = 1.64 이므로 신뢰구간을 쉽게 구할 수 있다.

= 56 – 3.28 < μ < 56 + 3.28

= 56 – 3.28 < μ < 56 + 3.28

= 52.72 < μ < 59.28

따라서 km 당 유연 휘발유 차량이 내뿜는 일산화탄소량 평균은 52.72 g 에서 59.28 g 사이일 것이라고 추정할 수 있다.

(3) σ 를 모르고 표본이 작은 경우

모표준편차 σ 를 모르는 경우에 표본평균의 확률분포에 대하여 제 6 장 2 절에서 상세히 설명한 바 있다. X ~ N(μ, σ2) 인 모집단으로부터 추출된 표본평균  의 확률분포는 평균이 μ 이고 분산이 σ2/n 인 정규분포를 따른다는 것을 배웠다. 그러므로 σ 가 알려져 있는 경우 μ 에 대한 (1 – α) 를 신뢰계수로 하는 신뢰구간은  이다.

이제 σ 를 모르는 경우 표본이 충분히 크다면 σ 대신에 표본에서 구한 표준편차 s 를 사용한다. 그러면 표본평균에 대한 표준화 변수  는 표준정규분포에 접근한다. 그러나 표본 크기가 작을 때에 표준화 변수 Z 는 표준정규분포에 접근하지 않는다. 즉, 표본 크기가 작을 때 변수 변환된  는 표준정규분포하지 않고 t-분포한다는 것을 제 6 장 2 절에서 설명한 바 있다.

이러한 t-분포는 자유도가 커짐에 따라 표준정규분포에 접근하게 된다. 그렇다면 표본 크기가 작다는 기준은 무엇인가? 일반적으로 표본 크기가 30 보다 적으면 작은 표본으로 분류하여 t-분포를 이용한다. 이제 t-표본에서 사용되는 자유도의 개념을 살펴보자.

자유도 개념을 알기 쉽게 설명하기란 매우 어렵다. 특히 통계학을 처음 공부하는 사람에게 자유도는 매우 생소한 개념이다. 그렇지만 자유도는 t-분포에서 확률을 구하는데 매우 중요한 역할을 한다. 표본에서 표준편차를 계산하거나 또는 t-분포에서 확률을 구하는데, 자유도는 매우 중요한 역할을 한다. 표본에서 표준편차를 계산함에 있어 자유도는 독립적인 편차의 수를 의미한다.

편차의 합  은 0 이다. 만약 편차의 합 중에서 (n – 1) 개까지 편차 합을 알 수 있다면, 나머지 편차 하나는 자동적으로 알 수 있다. 따라서 n 개 편차 중에서 (n – 1) 개 편차만이 자유롭게 변한다는 의미이다. 그래서 표본 크기가 n 일 때 자유도는 (n – 1) 이라한다. 표본 크기가 비교적 작을 때 t-분포는 자유도가 변함에 따라 확률은 민감하게 변한다. 그리고 변수 변환된 t 가 어떠한 범위의 값을 갖게 될 확률은 부록 마 에 나타나 있다.

부록 마 t-분포표를 이용하는 방법을 설명하기로 하자. t-분포표를 이용하는 방법을 설명하기로 하자. t-분포표로부터 자유도가 4 인 경우, t 값이 0.271 을 초과할 확률은 0.40 이고 1.533 을 초과할 확률은 0.10 이다. 그리고 t-분포 또한 0 을 중심으로 좌우 대칭이므로 t 값이 –0.271 보다 작을 확률은 0.40 이고, -1.533 보다 작을 확률은 0.10 이다.

이렇게 σ 를 모르고 표본 크기가 작은 경우에 모평균에 대한 신뢰구간은 표준화 변수  대신에  를 사용해야 한다. 그러므로 표본 크기가 작은 경우 신뢰계수 (1 – α) 에서 모평균에 대한 신뢰구간은 식 10 으로 구할 수 있다.

σ 를 모르고 표본크기가 작을 때 모평균에 대한 신뢰구간 :

 

식 10

예제를 통하여 t-분포에 의한 신뢰구간이 어떻게 추정될 수 있는지 알아보자.

예제 3

외부세계로부터 얻는 정보 중에서 85 % 는 시각을 통해서 들어온다고 한다. 그래서 같은 정보량일지라도 귀로 듣기보다 활자로 읽는 편이 빠르다. 일반적으로 보통 책 한쪽에는 약 600 자 글자가 적혀있다. K 대학에 학생 16 명을 표본으로 뽑아 책 한 쪽을 읽는데 걸리는 시간을 조사하였다. 조사 결과 한 쪽을 읽는 데 걸리는 시간은 평균 90 초이고 표준편차는 24 초이다. 그렇다면 K 대학 모든 학생들이 책 한 쪽을 읽는 데 걸리는 평균 시간에 대하여 95 % 를 신뢰계수로 구간추정하라.

풀이 3

표본크기가 16 이므로 표본 크기가 작은 경우 신뢰구간에 대한 문제이다. 예제로부터 n = 16 이므로 자유도는 15 이며  는 90 이고 s 는 24 이다. 그러므로 신뢰계수가 0.95 일 때 식 10 을 이용하여 신뢰구간을 구할 수 있다. 자유도가 15 일 경우 부록 마 t-분포표로부터  이다.

= 90 – 2.131(6) < μ < 90 + 2.131(6)

= 90 - 12.79 < μ < 90 + 12.79

= 77.21 < μ < 102.79

따라서 책 한 쪽을 읽는데 걸리는 평균 시간은 77.21 초에서 102.79 초 사이일 것이라고 추정할 수 있다.

4. 모비율에 대한 구간추정

분석의 대상이 되는 모집단에서 특정한 성격으로 나타나는 모비율에 관심을 두는 경우가 있다. 예를 들면 생산공장에서 생산되는 제품의 불량비율이라든가, 정부 정책에 대한 국민의 지지율 둥에 추정할 필요가 있다. 또한 여성의 흡연비율, 산모가 젖을 먹이는 비율 등에 대하여 추정하는 경우도 있다. 그런데 관심의 대상이 되는 모비율은 정확하게 알려져 있지 않다. 따라서 모집단으로부터 표본을 추출하여 표본에서 구한 표본비율을 바탕으로 모비율을 추정한다.

그렇다면 모비율에 대한 신뢰구간은 어떻게 추정할 수 있을까? 모비율에 대한 구간추정을 이해하기 위해서는 제 4 장 2 절과 제 6 장 3 절에 있는 내용을 복습할 필요가 있다. 왜냐하면 이항분포와 표본비율의 확률이론을 바탕으로 모비율에 대한 신뢰구간이 전개되기 때문이다.

어떠한 모집단으로부터 크기가 n 인 표본이 추출되었을 경우 성공 횟수를 x 라 하자. 그러면 표본비율 p 는 x/n 이다. 이제 모비율이 π 이고 표본에서 성공 횟수를 X 라 할 때 확률변수 X 의 기대치는 nπ 이다. 따라서 표본비율 p 는 x/n 으로 나타나므로 표본비율의 기대치는 모비율과 같다.

또한 표본비율의 표준편차는 제 6 장 3 절에서 설명한 바 있다. 표본비율의 분산은 π(1 – π)/n 이므로 표본비율의 표준편차는 당연히  이다. 따라서 표본비율의 확률분포는 기대치가 π 이고 분산이 π(1 – π)/n 이며 정규분포한다. 즉, p ~ N(π, π(1 – π)/n) 이다. 이러한 표본비율의 확률분포로부터 모비율에 대한 신뢰구간을 추정하는 식을 이끌어낼 수 있다.

표본비율을 표준화 변수로 변환하면  이다. 표본비율에 의한 표준화 변수 Z 는 표준정규분포하므로 신뢰계수를 (1 – α) 로 할 때 표본비율의 범위는 식 11 로 나타난다.

표본비율이 갖는 범위 :

 

식 11

식 11 에서 { } 내에 표현되어 있는 부분을 전개하여 모비율의 신뢰구간을 얻을 수 있다.

 , 각항에서 π 를 뺀다.

 , 각항에서 p 를 뺀다.

 , 각항에 –1 을 곱한다.

위에 나타난 마지막 표현 식은 모비율 π 가 포함될 신뢰구간을 나타낸 것이다. 그런데 모비율 π 는 알려져 있지 않기 때문에  을 구할 수 없다. 따라서 모비율 π 에 대한 신뢰구간을 추정할 수 없다.

그러나 표본 크기 n 이 충분히 크면, 표본비율은 모비율에 대하여 불편추정량이다. 그러므로 π 대신에 p 를 사용할 수 있다. 따라서 표본이 충분히 크고 신뢰계수가 (1 – α) 일 때 모비율에 대한 신뢰구간은 식 12 와 같다.

모비율에 대한 신뢰구간 :

 

식 12

만약 유한모집단으로부터 추출된 표본이라면 유한모집단 수정항  으로 식 12 를 수정하여 사용할 수 있다.

예제 4

본디 한글날은 1926 년 조선연구회 (한글학회의 전신) 에 의해 '가갸날' 이란 이름으로 제정하였다. 가갸날은 1928 년에 '한글날' 로 이름이 바뀌었고, 그 뒤 기념 날짜는 몇 차례 변경되었다. 그러다 1940 년 경북 안동에서 「훈민정음」원본이 발견되어, 한글 반포 날짜가 밝혀져 해방되던 해에 한글날이 10 월 9 일로 확정되었다. 그리고 한글 반포 500 주년을 맞아 한글날이 공휴일로 제정되었다. 그러던 중 1991 년 총무처에서 한글날을 법정 공휴일에서 제외하기로 결정하였다.

그러면 한글날이 법정 공휴일에서 제외된 것에 대하여 우리 국민은 얼마나 찬성하고 있을까? 100 명을 표본 추출하여 한글날이 법정 공휴일에서 제외된 것에 대한 조사를 했더니 40 명이 찬성하였다고 하자. 그렇다면 한글날이 법정 공휴일에서 제외된 것에 대하여 우리 국민이 찬성하는 비율은 얼마나 될까? 90 % 를 신뢰계수로 구간 추정하라.

풀이 4

전체 모비율에 대한 신뢰구간을 구하는 문제이다. n = 100, p = x/n = 40/100 = 0.40 이고 신뢰계수가 90 % 이므로 1 – α = 0.90 이며  이다. 따라서 모비율에 대한 신뢰구간은 식 12 를 이용하여 구할 수 있다.

= 0.40 – 1.64(0.049) < π < 0.40 + 1.64(0.049)

= 0.32 < π < 0.48

따라서 신뢰계수가 90 % 일 때 모비율은 0.32 에서 0.48 사이에 있을 것이라고 추정할 수 있다.

5. 모분산에 대한 구간추정

이번 절에서는 모분산 σ2 에 대한 구간추정을 설명하기로 한다. 모분산의 구간추정도 표본분산의 확률분포를 이용하여 이루어진다. 제 6 장 5 절에서 표본분산의 확률분포를 설명한 바 있다.

모분산이 σ2 인 모집단으로부터 크기가 동일한 표본을 무수히 많이 추출할 수 있다. 그러면 표본에서 구한 분산 s2 은 변화한다. 그러므로 표본분산을 모분산과 비교하여 변화시킨  는 자유도가 (n – 1) 인 x2-분포한다.

x2-분포표는 부록 바에 수록되어 있다. 따라서 x2 값이 일정한 구간에 있을 확률은 식 13 으로 나타날 수 있다.

 x2 값과 확률 :

식 13

이제 식 13 에서 { } 안에 있는 x2 범위로부터 모분산 σ2 에 대한 신뢰구간을 유도해 보자.

 , 각 항에 (n-1)s2 을 나눈다.

 , 각 항에서 역함수를 취한다.

 그러므로 모분산 σ2 에 대한 신뢰구간을 추정하는 식 14 를 얻을 수 있다.

 모분산에 대한 신뢰구간 :

식 14

식 14 에서 신뢰계수가 (1 – α) 이고 자유도가 (n – 1) 이면 x2 값이 각각 , 로 표시되어 있다. x2 값은 부록 바에서 쉽게 구할 수 있다.

모평균과 모비율에 대한 구간추정을 위해서는 표준정규분포나 t-분포를 이용한다. 표준정규분포나 t-분포는 0 을 중심으로 좌우 대칭이기 때문에 α/2 에 해당하는 Z 나 t 값을 이용한다. 그러나 x2-분포는 좌우 대칭이 아니므로 자유도에 대응하는   와  값을 각각 구해야 한다.  와  를 구체적으로 나타내면 그림 3 과 같다.

그림 3  (1 – α) 수준에서 x2 값

예제를 풀어보면 모분산에 대한 구간추정을 이해하는데 도움이 될 것이다.

예제 5

요즈음 학생들에게 필기도구로 인기 있는 것은 M 회사제품인 '젤러펜' 이다. 그런데 학생들은 젤러펜 잉크가 불규칙하게 닳아 없어진다고 불평한다. 즉 젤러펜 수명이 들쭉날쭉하다고 불평이 대단하다. 그래서 M 회사 제품인 젤러펜 15 자루를 표본 추출하여 몇 글자나 쓸 수 있는지 조사하였다. 조사결과 쓸 수 있는 글자수는 평균 10,000 자이고 분산이 2,000 자라고 한다. 그렇다면 전체 집단에서 젤러펜이 쓸 수 있는 글자 수는 얼마나 들쭉날쭉한가? 즉 모분산에 대하여 95 % 를 신뢰구간으로 구간추정하라.

풀이 5

위 문제는 모분산에 대한 신뢰구간을 구하는 예제이다. 따라서 모분산에 대한 구간추정을 구하는 식 14 를 이용할 수 있다. 표본크기가 15 이므로 자유도는 (n – 1) 로서 14 이다. 그리고 신뢰계수가 0.95 이므로 부록 바 x2-분포표로부터  와  를 구한다. x2-분포표에 의하여  는 5.629 이고  는 26.119 이다. 모분산에 대한 신뢰구간을 구하면 다음과 같다.

= 1,072.0 < σ2 < 4,974.2

따라서 젤러펜이 쓸 수 있는 글자 수 분산은 1,072 글자에서 4,974 글자 사이에 있을 것이다.

6. 모평균과 모비율 차의 구간추정

이제까지는 하나의 단일 모집단이 갖는 모평균, 모비율, 모분산에 대한 구간추정에 관하여 설명하였다. 그런데 통계조사는 때때로 두 모평균 차이 또는 두 모비율 차이를 추정하는데 그 목적을 두는 경우가 있다. 예를 들면 대도시와 농어촌 학생들의 체력 차이에 관하여 구간추정을 할 필요가 있다. 또한 대기업과 중소기업 근로자의 평균 근무 연수 차이에 관하여 구간추정하는 경우도 있다. 뿐만 아니라 두 공장에서 동일한 제품을 생산하는데 각 공장에서 생산된 제품의 불량비율 차에 대한 구간추정이 필요한 경우도 있다. 이번 절에서는 두 모집단 사이에 존재하는 모평균 차이와 모비율 차이에 대한 신뢰구간을 설명하도록 한다.

(1) 두 모평균 차의 구간추정

이제 서로 다른 두 모집단이 있다고 하자. 평균이 μ1 이고 표준편차가 σ1 인 첫 번째 모집단과 평균이 μ2 이고 표준편차가 σ2  인 두번째 모집단이 있다. 두 모집단으로부터 크기가 각각 n1, n2 인 표본을 추출하였다고 하자. 만약 σ1, σ2 가 알려져 있고 가 n1, n2 충분히 크기만 하면 두 표본평균 차이는 아래와 같이 간략히 표시된 정규분포를 따를 것이다.

 

두 표본평균 차이는 확률변수로서 기대치가 μ1 - μ2 이고 분산이  인 정규분포한다는 내용은 이미 제 6 장 4 절에서 배운 바 있다. 그러므로 두 표본평균 차에 대하여 표준화 변수로 배운 바 있다. 그러므로 두 표본평균 차에 대하여 표준화 변수로 변환하는 식은 식 6-10 으로 나타나며 Z 는 표준정규분포한다. 따라서 식 6-10 으로부터 두 모평균 차에 대한 신뢰구간은 식 15 로 표현될 수 있다.

두 모평균 차의 신뢰구간 :

 

,

단

식 15

그런데 식 15 를 적용하여 두 모평균 차에 대한 신뢰구간을 추정함에는 문제가 발생된다. 왜냐하면 모분산  은 대부분 알려져 있지 않기 때문이다. 만약 표본 크기가 충분히 크다면 중심 극한정리에 의하여  과  대신에 표본분산  과  을 사용할 수 있다. 여기서  는 첫 번째 표본에서 분산이고  는 두 번째 표본에서 분산을 의미한다.

그러므로 표본 크기가 충분히 크기만 하면 표본평균 차  는 그 기대치가  이고 분산이  인 정규분포에 접근한다. 따라서 두 모평균 차에 대한 신뢰구간을 구하는 식 15 는 식 16 으로 바꾸어 사용할 수 있다.

 과  를 모르는 경우 두 모평균 차의 신뢰구간 :

 

 

식 16

 

예제 6

대기오염과 함께 수질오염도 심각한 환경문제로 대두되고 있다. 수질오염도를 측량하는 단위는 BOD (Biochemical Oxygen Demand) 이다. BOD 란 생물화학적 산소 요구 량으로서 20 ℃ 물에서 5 일간 미생물에 의해 분해되는 탄소물질 산화에 필요한 산소 량이다. 지난 십여 년 간 금강 하류의 수질오염은 심해진 반면 한강 하류의 수질오염은 많이 개선되었다고 한다.

금강 하류와 한강 하류의 수질오염도 차이가 어느 정도인가를 밝히고자 각각 100 번씩 표본 추출하여 BOD 조사를 시행하였다. 조사결과에 의하면 금강 하류에서 수질 오염도는 평균이 4.8 ㎎/ℓ 이고 분산이 0.9 ㎎/ℓ 이며, 한강 하류에서 오염도는 평균이 3.3 ㎎/ℓ 이고 분산이 1.6 ㎎/ℓ 이다. 95 % 를 신뢰구간으로 금강 하류와 한강 하류에서 평균 수질오염도 차이를 구간추정하라.

풀이 6

금강 하류와 한강 하류에서 수질오염도의 모평균을 각각 μ1 , μ2 라 하자. 금강 하류에서 추출된 표본을 n1, 한강 하류에서 추출된 표본을 n2 라 하자.

그러면 , , ,  이므로 식 16 을 이용하여 모평균 차에 대한 신뢰구간을 쉽게 구할 수 있다. 표본 크기는 n1 = n2 = 100 으로 충분히 크기 때문에 모분산  대신에 표본분산  을 사용한다.

= 1.5 – 1.96(0.05) < (μ1 - μ2) < 1.5 + 1.96(0.05)

= 1.5 – 0.098 < (μ1 - μ2) < 1.5 + 0.098

= 1.402 < (μ1 - μ2) < 1.598

따라서 95 % 를 신뢰수준으로 할 때 금강 하류와 한강 하류에서 수질 오염도의 평균 차이는 1.402 ㎎/ℓ 에서 1.598 ㎎/ℓ 사이일 것이라고 추정할 수 있다.

그런데 만약  를 모르고 표본 크기 n1 , n2 도 작을 경우에는 모평균 차의 신뢰구간은 식 16 을 이용할 수 없다.  를 모르고 표본 크기가 작을 때에는 제 6 장 4 절에서 설명한 t-분포를 이용하여야 한다. 다시 말하면  대신에  를 사용해야 한다.

(2) 두 모비율 차의 구간 추정

서로 다른 두 모집단이 있다 하자. 첫 번째 모집단에 모비율을 π1, 두 번째 모집단을 π2 라 하자. 첫 번째 모집단으로부터 크기가 n1 인 표본을 두 번째 모집단으로부터 크기가 n2 인 표본을 무작위로 추출한다. 그리고 두 표본은 서로 독립적이며 첫 번째 표본비율을 p1, 두 번째 표본비율을 p2 라 하자. 그러면 두 표본 크기가 충분히 큰 경우에 표본비율 차 (p1 - p2) 는 기대치가 (π1 - π2) 이고 분산이 π1(1 - π1)/n1 + π2(1 - π2)/ n2 인 정규분포 한다. 만약 두 표본 크기가 충분히 크고 신뢰계수 (1 – α) 가 주어졌다면 두 모비율 차이에 대한 신뢰구간은 식 17 로 나타난다.

두 모비율 차의 신뢰구간 :

 

 ,

식 17

그런데 실제로는 모비율 π1 과  π2 는 대부분 알 수 없다. 그래서 표본 크기가 충분히 클 때에는 π1 과  π2 대신에 표본비율 p1 과 p2 를 사용한다. 식 17 에서  는 표본비율 차의 표준편차를 의미한다. 다음 예제를 통하여 모비율 차에 대한 신뢰구간이 어떻게 추정되는지 살펴보자.

예제 7

술은 사람을 솔직 담백하게 하는 마력이 있는데 알코올이 혀를 풀어주기 때문이다. 술을 적당히 마시는 사람은 전혀 마시지 않는 사람보다 오래 산다는 조사 결과도 있다. 그러나 술로 인한 피해도 엄청나다. 술을 마시다 보면 술이 술을 먹고 급기야는 술이 사람을 마시게 된다.

그래서인지 대학생 사회에서는 '술 문화' 가 「1차」로 끝나지 않는 경우가 많다. 「2차」를 가야만 직성이 풀리는 대학사회의 음주문화이다. K 대학 학생 중에서 남학생과 여학생을 각각 100 명씩 표본 추출하여 조사하였다. 조사 결과 「2차」로 노래방을 가는 학생은 여학생이 40 명, 남학생이 20 명으로 나타났다. 90 % 를 신뢰계수로 K 대학 전체 여학생과 남학생이 「2차」로 노래방을 찾는 비율 차이에 대하여 구간추정하라.

풀이 7

여학생 집단의 모비율을 π1 , 남학생 집단의 모비율을 π2 라 하자. 그러면 예제에 요구하는 것은 두 모비율의 차 (π1 - π2) 에 대한 신뢰구간을 구하는 문제이다.

신뢰계수가 0.90 이므로  이다. n1 = n2 = 100 이며 여학생 표본비율은 p1 = 0.40 이고 남학생 표본비율은 p2 = 0.20 이다. 따라서 식 17 을 이용하면 모비율 차에 대한 신뢰구간을 쉽게 추정할 수 있다.

= 0.20 – 1.64(0.063) < (π1 - π2) < 0.20 + 1.64(0.063)

=0.20 – 0.103 < (π1 - π2) < 0.20 + 1.103

= 0.097 < (π1 - π2) < 0.303

따라서 모비율 차이는 9.7 % 에서 30.3 % 일 것으로 추정할 수 있다.

7. 표본크기 결정

모수를 추정할 때 신뢰구간 폭을 너무 넓게 추정하면 추정 결과는 의미가 없게 된다. 왜냐하면 구간추정에 정밀성이 없기 때문이다. 신뢰구간 폭에 영향을 미치는 것은 신뢰계수와 표본 크기이다. 신뢰계수가 주어졌다면 신뢰구간 폭에 영향을 미치는 것은 표본 크기이다. 표본이 크면 클수록 신뢰구간 폭은 작게 되어 정밀성 있는 구간추정이 될 수 있다. 한편 표본 크기가 주어졌다면 신뢰계수는 신뢰구간 폭에 영향을 미친다.

신뢰계수가 적으면 신뢰구간 폭이 작게되고, 신뢰계수가 크면 신뢰구간 폭이 커진다. 따라서 구간추정에서 표본이 크면 정밀성은 높게 되며 신뢰계수가 크면 정밀성은 낮아진다. 또한 표본이 작으면 정밀성은 낮게되고 신뢰계수가 작으면 정밀성은 높아진다. 그러므로 정밀성은 표본 크기에 비례하고 신뢰계수에 반비례하는 관계로 나타난다.

여기서 정밀성 (precision) 이란 추정치가 모수에 일치하는 정도를 의미하는데 '정밀도' 라고 부르기도 한다. 다시 말하면 정밀도란 추정치가 모수에 근접하는 정도를 뜻한다. 이제 표본 크기를 어떻게 결정해야 하는지 설명하기로 하자. 표본 크기는 모평균을 추정하기 위한 것인지 모비율을 추정하기 위한 것인지에 따라 다르게 결정한다.

(1) μ 를 추정할 때 표본 크기

제 6 장에서 설명한 대로 표본 크기 n 이 증가함에 따라 표준오차  는 작게 나타난다.  가 작으면 모평균에 대한 신뢰구간 폭도 적게 되어 정밀도를 높일 수 있다. 한편 표본 크기가 작으면 일반적으로 표본평균의 표준편차  는 크게 나타난다.  값이 크면 모평균에 대한 신뢰구간 폭도 크게 되어 정밀성 있는 추정을 할 수 없다.

그러므로 구간추정에서 요구하는 정밀성의 정도가 정해진 후에야 표본 크기를 결정할 수 있다. 표본 크기가 작으면 정밀성은 낮지만 표본추출이 간편하고 자료처리에 소요되는 시간과 비용이 절감된다. 한편 표본 크기가 크면 정밀성은 높지만 표본추출 과정이 번거롭고 자료 수집과 처리에 소요되는 시간과 비용이 증대한다. 그러므로 실험이나 관찰을 통해 자료를 수집하기 전에 정밀성의 수준을 미리 정해야 한다.

예를 들면 수많은 전구의 평균 수명에 대하여 추정한다고 하자. 전구를 생산하는 회사에서는 표본평균이 모평균과 30 시간 이내로 차이가 날 것을 원한다고 하자. 이러한 경우 모평균과 표본평균의 차이가 바로 정밀도이다. 즉, 정밀도를 30 시간으로 정한다는 뜻이다. 정밀도와 신뢰계수가 정해진다면 표본 크기는 쉽게 결정할 수 있다.

평균이 μ 이고 분산이 σ2 인 어떤 모집단으로부터 크기가 충분히 큰 표본이 추출되었다고 하자. 그러면 표본평균의 확률분포는 기대치가 μ 이고 분산이 σ2/n 인 정규분포한다. 따라서 신뢰계수가 0.95 인 경우에 표본평균이 가질 수 있는 범위는 식 18 로 나타난다.

1 – α = 0.95 일 때  값이 가질 수 있는 범위 :

 

식 18

식 18 로부터 각 항에서 μ 를 빼서 정리하면 정밀도의 범위를 알 수 있다.

1 – α = 0.95 일 때 정밀도  의 범위 :

 

식 19

식 19 는 신뢰계수가 0.95 일 때 정밀도의 범위를 나타낸 것이다. 여기서 정밀도는 모평균과 표본평균의 차이로 표현되는  이므로, 예로부터 정밀도는 30 이 된다. 따라서 정밀도는  과 같다는 의미이다. 만약 전체 모집단에서 표준편차가 120 으로 나타났다면 표본 크기는 다음과 같이 구할 수 있다.

= 61.47 ≒ 62

따라서 신뢰계수가 0.95 이고 정밀도 수준이 30 인 경우 표본 크기는 62 개로 결정된다. 표본평균이 모평균으로부터 δ 를 초과하지 않게 나타날 확률이 (1 – α) 로 요구되면 표본 크기를 결정하는 일반화된 식 20 과 같다.

신뢰계수가 1 – α 일 때 표본 크기 결정 :

 

 

 , 단 δ 는 정밀도 범위

식 20

 

예제 8

K 대학 캠퍼스에는 K 은행 지점이 금융서비스업무를 담당하고 있다. 학생 1 명당 1 계좌를 갖고 있는데 1 계좌 당 평균 잔액이 얼마인지 궁금하다. 그러나 계수가 너무 많아서 전체를 모두 조사하기란 매우 번거롭다. 그래서 표본을 추출하여 평균 잔액 (= 모평균) 을 추정하고자 한다. 표본평균이 모평균으로부터 3 만원을 초과하지 않게 될 확률을 90 % 로 정한다면, 표본 크기는 얼마로 결정해야 하는가? 단, 모표준편차는 12 만원이라고 한다.

풀이 8

위 예제는 추정할 때에 크기를 결정하는 문제이다. 예제로부터 신뢰계수 (1 – α) = 0.90 이므로 그것에 대응하는 표준화 변수 값은  이다. 그리고  이 3 만원 이내이어야 하기 때문에 정밀도 δ = 3 만원이다. 모표준편차 σ = 12 만원이므로 만원 단위를 생략하고 표본 크기를 결정하는 식 20 을 이용하면 표본 크기를 쉽게 구할 수 있다.

그러므로 표본 크기는 44 개 정도이어야 한다.

(2) π 를 추정할 때 표본 크기

모비율을 추정하기 위하여 표본을 추출할 때에도 정밀도는 제시되어야 한다. 모비율을 추정하는 것이 목적이므로 표본비율과 모비율의 차이에 대한 범위가 정밀도이다. 예를 들어 K 지역 직장인들이 건강관리를 하고 있는 비율을 추정하려고 한다고 하자. 직장인 모두 조사할 수 없으므로 표본조사를 시행하고자 한다. 표본비율이 모비율로부터 차이가 5 % 이내로 될 확률이 0.95 가 되도록 하려면 표본 크기는 어떻게 결정해야 하는가?

모비율이 π 인 모집단으로부터 크기가 충분히 큰 표본을 추출한다고 하자. 그러면 제 6 장 3 절에서 설명한 바와 같이 표본비율은 평균이 π 이고 분산이 π(1 – π)/n 인 정규분포한다. 따라서 신뢰계수가 0.95 일 때 표본비율이 나타나게 될 범위는 식 21 과 같다.

신뢰계수가 0.95 일 때 표본비율의 범위 :

 

식 21

식 21 에서 각 항으로부터 π 를 빼면 정밀도 범위가 식 22 로 나타난다.

신뢰계수가 0.95 일 때 정밀도 (p – π) 의 범위 :

 

식 22

정밀도가 5 % 이내로 나타나야 함으로 식 22 로부터 다음 관계식이 성립된다.

 

만약 모비율 π 가 60 % 라 한다면, 표본 크기는 다음과 같이 구할 수 있다.

따라서 표본 크기는 369 정도로 결정할 수 있다.

이제 표본비율 p 가 모비율 π 로부터 δ 이내로 차이가 날 확률이 (1 – α) 라 하자. 그리고 모비율이 π0 라고 예상된다면 표본 크기는 식 23 에 의해서 결정된다.

 모비율 추정할 때 표본 크기 :

식 23

 

예제 9

'인구통계' 기준으로 15 세에서 64 세까지 인구를 생산가능인구라 하고, 유년 (0 ~ 14 세) 인구와 노년 (65 이상) 인구를 합해서 비생산인구라 한다. 그런데 1996 년에 우리나라 생간가능 인구가 부양해야 할 '총 부양비' 는 40.7 % 였다. 비생산 인구에 대한 생산가능 인구 비율을 총 부양비라고 하는데, 총 부양비 크기는 생산가능 인구의 경제적 부담을 의미한다.

이제 중소도시 K 지역에서 표본추출에 의하여 총 부양비를 조사하고자 한다. 표본에서 구한 총 부양비가 전체 총 부양비로부터 4 % 이내로 차이가 날 확률을 90 % 로 정한다면, 표본 크기는 얼마로 결정해야 하는가? 단, K 지역에서 총 부양비는 40 % 로 예상한다.

풀이 9

모비율을 추정할 경우에 표본 크기를 결정하는 문제이다. 예제로부터 (1 – α) 는 0.90 이고, 정밀도 δ 는 0.04 이며, π0 는 0.40 이다. 따라서 식 23 을 이용하여 표본 크기를 결정할 수 있다.

따라서 표본 크기는 404 이어야 한다.