회귀분석 추론
이야기로 배우는 통계학 : 이해용. 이필용 공저, 자유아카데미, 2003, page 493~519
신뢰구간이란 신뢰할 수 있는 범위를 뜻한다. 신뢰구간은 통계학에서 추론에 해당하는 내용이다. 추론이란 '추측하여 판정하는 이론' 이라는 뜻. 즉 추정과 검정 이론을 통틀어 통계학에서는 추론이라 한다.
회귀분석의 첫 번째 과제는 표본 자료로부터 이상적인 표본회귀선을 구하는 것이다. 그런데 최소자승법으로 구한 표본회귀선은 크게 두 종류 문제를 안고 있다.
첫째, 모회귀선은 표본회귀선으로부터 어떻게 추정되어야 하는가?
둘째, 표본회귀계수는 과연 의미가 있는 것인가?
이번 절에서는 이러한 문제에 대한 해결 방법을 설명하고 있다.
관심의 대상이 되는
모집단 회귀모형에서 모수
과
는 알려져 있지 않다. 그래서 모집단으로부터 표본을 추출하여 표본 자료에 접근되는
표본회귀선
를 구해야 한다. 그러면 표본회귀계수
은 모수
의 추정량이고, 표본회귀상수
는
의 점 추정량이다. 그러면 모수
과
는 어떤 범위의 값을 가질까?
점추정량은 모수에 가장 접근하는 표본 추정치로써 하나의 값으로 표현된다. 그러므로 점추정량에는 항상 오차가 존재하지만, 그 오차의 정도를 측정할 수 없다. 즉, 점추정에는 오차의 정도를 측정할 수 없어 신뢰성 정도를 알 수 없는 단점이 있다. 그러나 구간추정의 경우에는 모수가 포함될 범위로 추정하는 것이므로 신뢰성 정도를 포함하고 있다. 따라서 모수를 추정함에는 점추정보다 구간추정 (interval estimate) 을 더 많이 사용한다.
앞 절에서 설명한 예제
1 을 다시 살펴보자. 5 농가의 표본 자료로부터 구한 표본회귀계수 (
) 는 0.700 이다. 따라서 전체 농가의 모회귀계수 (
) 는 0.700 이라고 추정하는 것이 점추정이다. 한마디로 점추정이란 표본에서
구한 통계량으로 모수를 하나의 값으로 추측하여 판정한다는 뜻이다. 그런데 점추정치는
모수에 대하여 오차의 정도나 신뢰성을 포함하고 있지 못하다.
오차의 정도를 포함시켜
모수 (
) 가 포함될 범위에 대하여 표본회귀계수 (
) 로 기준으로 추정하는 것이 구간추정이다. 즉 신뢰성 정도를 고려하여
이
에 얼마나 접근되는 값인지 확률구간으로 추정하는 것이 구간추정이다.
과
사이에 확률관계로 표현한 것이 식 1 이다.
|
|
식 1 |
식 1 에서 { } 안에
표시되어 있는 범위를 신뢰구간 (confidence interval) 이라 한다. 한편 1 - α 를
신뢰계수 (confidence coefficient) 라 한다. 그리고 α 를 유의수준 (significance
level) 이라 하고, 가설검정에서 제 1 종 오류를 범할 확률을 의미한다. 즉, 귀무가설
(
) 이 참인데도 불구하고
을 기각할 때 발생하는 오류를 의미한다. 여기서 제 1 종 오류에 대하여 이해하지
못하는 독자는 제 8 장에서 설명한 가설검정 내용을 공부하기 바란다.
구간추정에서는 신뢰구간이라는 표현을 자주 사용하는데 그 뜻을 바르게 이해해야 한다. 그러면 식 1 에서 신뢰구간의 뜻을 살펴보자.
첫째, 신뢰구간은 표본회귀계수
(
) 에 따라 범위가 변하게 된다.
그런데
는 표본 자료에 따라 변하는 확률변수이므로 표본에 따라 신뢰구간은 변하게
된다.
둘째, 모회귀계수 (
) 를 포함하게 될 구간을 설정할 확률이 1 - α 라는 것을 의미하는 것이 아니다.
즉 신뢰구간이
에 의하여 변하는 확률적 구간이므로 표본이 무수히 많이 추출되는 경우에 신뢰수준으로
이해하여야 한다.
그러면 모회귀모형
에서
과
가 갖게 될 신뢰구간은 어떻게 설정하는가? 표본으로부터 구한 추정량
과
의 표본분포로부터 신뢰구간을 구할 수 있다.
의 신뢰구간회귀분석에서 관심의
대상은 모집단이 갖는 모회귀모형이다. 모회귀모형
에서 모수
은 모회귀계수로서 알려져 있지 않다. 그러므로 모집단으로부터 표본을 추출하여
최소자승법으로 표본회귀계수
를 구한다.
그런데 모수
은 유일한 값을 갖지만, 표본회귀계수
은 표본에 따라 변한다. 그러면 추정량으로서 표본회귀계수
은 어떠한 표본분포로 나타날 것인가? 앞장 예제 1 로부터
와
의 관계를 그림으로 표현한 것이 그림 1 이다.

그림 1
의 확률분포
그림 1 에서 모회귀모형
를 갖는 모집단으로부터 크기 (n) 가 5 인 표본을 무수히 많이 추출할 수 있다.
그러면 각 표본 자료에서 최소자승법으로 표본회귀선을 구하면 표본회귀계수
은 그 기대치가
이고 분산
이
이며 정규분포한다. 이러한
를 표준화 변수로 변환한 것이 식 2 이다.
|
|
식 2 |
식 2 에서 표준화 변수
Z 는 5 장 3 절에서 설명한 바와 같이 평균이 0 이고 분산이 1 인 표준정규분포한다.
그런데 식 2 에서 교란항의 분산
은 알려져 있지 않으므로 표준화 변수 값을 구할 수 없다. 그래서
대신에 표본회귀선의 잔차로부터 구한 추정치
를 사용한다. 그러나 식 2 에서
대신에
를 사용하여 변수 변환하면, 변환된 변수 (t) 는 더 이상 표준정규분포하지 않고
t 분포한다.
식 3 에서
는 표본회귀계수
의 표준오차이고, 변환된 변수 t 는 자유도가 (n - 2) 인 t 분포를 따른다.
|
|
식 3 |
그러므로 모회귀계수
에 대한 신뢰구간을 구하기 위해서는 표준정규분포 대신에 t 분포를 사용해야
한다. 제 6 장 2 절에서 설명한 바와 같이 t 분포는 자유도에 의하여 민감하게 변하고
0 을 중심으로 좌우 대칭의 모습이다. 따라서 유의수준이 α 일 때 t 통계량이 갖는
확률범위는 식 4 로 표현된다.
|
t
통계량의 확률범위 : |
식 4 |
식 4 에서 { } 안에
있는 범위를 정리하면 1 - α 신뢰계수로
에 관하여 신뢰구간은 식 5 로 구할 수 있다.
|
|
식 5 |
(예제 1) 예제 10.1
표본자료로부터 표본회귀계수 (
) 는 0.700 이고 표본회귀계수의 표준오차
는 0.0577 이다. 그러면 모회귀계수
에 대하여 95 % 신뢰계수로 신뢰구간을 구하라.
(풀이 1)
= 0.700 이고
= 0.0577 이므로 모회귀계수
에 대한 신뢰구간은 식 10-32 를 이용하여 쉽게 구할 수 있다. α = 0.05 이고
표본 크기 (n) 는 5 이므로 자유도가 3(= n - 2) 인 t 분포에서
값은 부록 나 에서 3.182 이다.

그러므로 95 % 신뢰수준에서
모회귀계수
의 신뢰구간은 0.5164 에서 .8836 이다.
의 신뢰구간
에 대한 신뢰구간을 구하는 과정은
의 신뢰구간과 같다.
의 신뢰구간은 표본회귀계수
을 기준으로 구하는 것과 같이
에 대한 신뢰구간은 표본회귀상수
을 기준으로 구할 수 있다.
그러면 표본회귀상수
이 갖는 표본분포의 특성을 알아보자.
인 정규분포를 따른다. 그러나 모집단에서 교란항의 분산
은 알려져 있지 않으므로 표본회귀선의 잔차로부터 추정한
을 사용할 수밖에 없다. 그러면
에 대하여 변수 변환한 식 6 은 t 분포를 따른다.
|
|
식 6 |
에 관한 신뢰구간을 구하는 식 5 와 마찬가지로
에 대한 신뢰구간은 식 7 로 구할 수 있다.
|
|
식 7 |
과
에 관한 신뢰구간을 살펴보았으나
보다
는 상대적으로 중요하게 다루지 않는다. 왜냐하면 추정치로서
가 먼저 계산된 다음
가 구해지는데,
는 단지 표본회귀선이 Y 축을 지나는 절편만을 나타내기 때문이다. 즉 표본회귀계수
에 의하여 결정되는 것이
이기 때문에
는
보다 중요하게 다루지 않는다.
회귀분석에서 가설검정을 종종 유의성 검정이라고 한다. 그러면 유의성 (significance) 이란 무슨 뜻일까? 유의성이란 낱말에 대하여 많은 사람들이 그 뜻을 잘못 이해하여 혼동하는 경우가 많다. 왜냐하면 많은 책에서 유의성에 대하여 바르고 알기 쉽게 설명하고 있지 않기 때문이다.
유의성이란 '의미가 있는 성질' 또는 '표시하고 있는 성질' 이라는 뜻이다. 즉 모집단에서 모수가 갖는 성질이 표본에 그대로 나타나서 표본 통계량이 추정량으로서 의미가 있을 때, 유의성이 있다고 표현한다. 다시 설명하면 회귀분석에서는 모회귀모형에서 모수가 갖는 성질이 표본회귀선에서 그대로 나타날 때 유의성이 있다고 말한다. 유의성이란 개념을 분명하게 이해하고자 재미있는 옛날 이야기를 보듬어 보자.
|
옛날 어떤 고을에 딸 셋을 둔 영감이 살고 있었는데, 그는 젊은 시절부터 열심히 일을 하여 여유 있게 살아왔다. 그러나 딸 셋을 정성 들여 키운 후 모두 시집을 보내게 되었다. 그러나 딸 셋을 정성 들여 키운 후 모두 시집을 보내게 되었다. 평생을 딸 키우는 재미로 살다가 딸을 모두 시집보내고 나니 늙은 내외만 남게되어 쓸쓸하였다. 그래서 양자를 들여서 양며느리를 보게 되었다. 양자와 양며느리와 함께 살다보니, 핏줄도 다른 젊은이들을 고생시키는 것 같아 따로 세간을 떼어 내보냈다. 또다시 늙은 내외만 남게 되어 쓸쓸히 살다보니 어느새 죽을 날이 멀지 않게 되어 재산을 물려주려는 궁리를 하게 되었다. 양아들과 양며느리가 있지만, 그래도 제 핏줄로 이어진 딸한테 마음이 더 쏠렸다. 몇 십 마지기 되는 논밭을 모두 양며느리에게 물려주는 게 아까운 생각이 들었다. 그래서 이참에 직접 딸들을 만나보고 나서 논밭뙈기를 떼어 주리라 마음을 먹고 영감은 딸네 집으로 발걸음을 향했다. 먼저 첫째 딸네 집에 갔다. 가서보니 다른 식구들은 아무도 없고 첫째 딸 혼자서 베틀에 올라앉아 베를 짜고 있었다. "얘야 !, 내가 왔다. 애비가 왔어…!" 반가워서 큰 소리로 불렀더니, 글세 첫째 딸은 베틀 위에서 내려올 생각도 않았다. "아버지 오셨어요? 오시려면 진작 오신다는 말씀을 하고서 오시지, 이렇게 불쑥 오시면 어떡해요? 짜던 베를 다 짜놓고서 나갈 테니 밖에서 기다리세요." 이러면서 짤캉짤캉 베만 짜고 있는 게 아닌가! 그런데 한참동안 밖에서 기다려도 딸은 베틀에서 내려올 생각을 안 하기에 영감은 서운한 마음으로 돌아섰다. 그리고는 둘째 딸 집으로 갔다. 집 근처에 다다르고 보니 마침, 둘째 딸은 집 앞에 있는 개울에서 빨래를 하고 있었다. 영감은 무척 반가웠다. "얘야! 딸아! 내가 왔다. 애비가 왔어!" 반가운 마음으로 크게 불렀는데 둘째 딸은 힐끔 돌아보다가, 푸념 섞인 투로 이야기하는 게 아닌가. "아버지도 참!, 좀 한가할 때 오시지 하필이면 이렇게 바쁠 때 오셨어요? 빨래 감이 밀려서 그러니 이 빨래 다 할 때까지 거기서 기다리세요!" 그러고는 뚝딱뚝딱 빨래 방망이질만 하고 있는 게 아닌가. 얼마동안 개울 위 뚝방에 서서 기다려도 빨래만 하고 거들떠보지 않기에 영감은 서글픈 마음으로 그냥 돌아설 수밖에 없었다. 그리고 다시 셋째 딸 집으로 발걸음을 돌렸다. 어느새 땅거미가 질 무렵, 가서보니 셋째 딸은 한창 저녁 밥상을 차리고 있었다. "얘야! 딸아! 내가 왔다. 애비가 왔어!" 반가운 마음으로 큰 소리고 불렀는데, 그만 셋째 딸은 땅이 꺼져라하고 한숨을 내쉬면서, 하는 말! "시집 식구들 숫자대로 딱 맞추어 밥을 지었는데 이렇게 불쑥 오시면 어떡해요? 아버지 때문에 밥을 더 지어야 하니 한참 기다리세요." 라고 하면서, 아버지한테는 눈총도 안주고 딸강딸강 밥상만 차리고 있었다. 영감은 한참동안 문밖에서 기다리고 있는데도 셋째 딸은 새로 밥을 짓는 기미는 안 보이고 밥그릇만 딸강거리기에 그만 되돌아서고야 말았다. 그런데 되돌아 집에 오는 길에 양며느리 집에 들렸다. 날이 저물어 가는데 양며느리는 여물을 썰고 있다가 그만 양아버지께서 오시는 것을 보고 달려나와 반갑게 맞이하였다. 그리고는 곧장 씨암탉을 잡고 더운밥을 지어 양아버지를 극진히 대접하였다. 밤이 깊어 영감은 양며느리 집에서 하룻밤을 지새우는데 잠이 오지 않았다. 세 딸로부터 냉대 받은 것에 분하고 궁금증만 더해갔기 때문이다. 그리고 마음속으로 물음표만 떠올랐다. "애비를 냉대한 것이 과연 세 딸의 본 마음인가…?" 집에 돌아와서 영감은 꾀를 내어 딸의 마음을 다시 확인하고 싶었다. 그래서 자기가 죽은 것으로 하여 세 딸집에 부고장을 보냈다. 그러고는 병풍을 둘러치고 그 뒤에서 거절을 뒤집어쓰고 죽은 체 누워 있었다. 그랬더니 아버지가 죽었다는 소식을 듣고 딸들이 달려왔다. 먼저 첫째 딸이 달려와서 머리를 풀어 제치고 얼마나 구슬피 우는지 문상을 온 사람들 눈에서 눈물이 날 지경이었다. "아이고 아버지, 아이고 아버지. 며칠 전 우리 집에 오셨을 때 베짜다 말고 달려나가 씨암탉 잡아 푹 과 드렸더니, 맛있게 드시고 나서 재 넘어 논 닷 마지기를 주신다고 하시더니 이렇게 갑자기 돌아가시다니요…. 아이고 아버지, 아이고 아버지." 그 다음에 둘째 딸이 달려와서 땅바닥을 탕탕치고 몸부림치며 어찌나 애통하게 우는지… "아이고 아버지, 아이고 아버지. 얼마 전 우리 집에 오셨을 때 제가 빨래하다 말고 씨돼지 잡아 국 끓여 드렸더니 맛있게 드시고 나서, 강 건너 밭뙈기 주신다고 하시더니 돌아가시다니요...아이고 아버지, 아이고 아버지." 곧이어 셋째 딸이 달려오더니 대문에서부터 데구르르 구르더니 몸부림치며 까무러치듯 곡을 하는데, "아이고 아버지, 아이고 아버지, 엊그제 우리 집에 오셨을 때 저녁 밥상 차리다 말고 송아지 잡아 술을 대접해 드렸더니 흔쾌히 드시고 나서 아랫마을 과수원 밭 몽땅 너를 주마하시더니, 이렇게 돌아가시다니요…. 아이고 아버지, 아이고 아버지." 세 딸이 모두 그렇게 구슬피 통곡하니 문상객들은 딸들 효심에 눈물을 글썽였다. 그러나 병풍 뒤에 누워 있던 영감은 세 딸의 통곡소리를 듣고서 기가 막혔다. 그래서 부아가 치밀어 참지 못하고 벌떡 일어나 병풍을 걷어차고 호통을 쳤다. "이런 못된 년들! 무엇이 어째고 어째? 네가 언제 씨암탉 잡아 과주었어? 네가 언제 씨돼지 잡아 국 끓여 줬어? 네가 언제 송아지 잡아 술을 대접했어? 내죽음이 진짜 죽음인줄 알았더냐! 못된 것들아!" 거짓으로 죽었던 영감은 그 뒤로 오래오래 살다가 재산은 몽땅 양며느리한테 물려주었다고 한다. (주석 : 여기에 옛날 이야기는 서정오글, 현암사 간 <우리 옛이야기 백가지> 에서 뽑아 지은이가 약간 수정한 것이다.) |
우리 나라에서 전해오는 옛날이야기는 대부분 유의성을 주제로 삼고 있다. 늙은 아버지가 세 딸집에 들렸을 때 그때의 딸들 태도가 딸들의 본디 참 모습이다. 한편 병풍 앞에서 울부짖은 세 딸의 통곡소리는 표본에 나타난 통계량이라 할 수 있다. 그렇다면 표본에서 딸들의 울음은 참 모습을 담고 있는가? 아니다. 단지 거짓울음이다.
즉 표본에 나타난 통계량이 모집단의 참 모습을 담고 있지 않다. 표본으로 나타난 딸들의 울음은 아무런 의미가 없다. 딸들의 울음에는 참이 담기지 않은 것이다. 이러한 경우에 표본 통계량은 모집단의 참 모습 [모수] 을 담고 있지 못하기 때문에 '유의성이 없다' 고 표현한다.
그러면 회귀분석에서
유의성이란 구체적으로 무슨 뜻을 갖고 있을까? 만약 귀무가설 (
) 이 참이라면 표본 자료로부터 구한 표본회귀계수 (
= 0.700) 는 아무런 의미가 없는 것이다. 단지 표본에서만 나타난 가짜 눈물일
뿐이다. 그러므로 이러한 경우에 표본회귀계수
은 유의성이 없다고 표현한다.
한편 귀무가설 (
) 이 기각될 때 표본회귀계수 (
= 0.700) 는 의미가 있으므로 유의성이 있다고 표현한다. 따라서 가설검정으로부터
유의성 유무를 알 수 있기 때문에 가설검정을 유의성 검정이라고 부른다.
의 유의성 검정표본 자료로부터 최소자승법으로
구한 표본회귀계수
는 모회귀계수
에 대하여 유의성이 있는 추정량인가? 즉, 표본회귀계수는 모회귀계수에 대하여
의미가 있는 추정량인가? 어떤 모집단으로부터 크기가 동일한 표본은 무수히 많이
추출할 수 있다. 그러면 각 표본으로부터 최소자승법으로 구한 표본회귀계수는 일정한
값으로 나타나지 않고 변하므로 확률변수이다.
모집단 회귀모형에서
모회귀계수
는 유일한 값을 갖지만, 표본회귀계수 (
) 는 유의성이 없게 된다. 왜냐하면 모회귀계수가 0 이라면 모집단에서는 선형회귀모형이
존재할 수 없기 때문이다. 모회귀선이 존재할 수 없는데 표본회귀선은 아무런 의미가
없는 것이다.
이제 예제 10.1 에서
구한 표본회귀계수 (
) 는 추정량으로서 의미가 있는 것인가? 유의성 검정에 대하여 설명하도록 하자.
앞에서도 설명한 바와 같이 유의성이란 가설을 검정하므로서 밝혀질 수 있다. 그러므로
가설검정을 유의성 검정이라고 표현하기도 한다. 따라서 귀무가설을 채택할 것인가,
아니면 기각할 것인가를 표본 통계량으로부터 검정해야 유의성 유무를 알 수 있다.
모집단 회귀모형에서
= 0 일 수도 있고
≠ 0 일 수도 있을 것이다.
만약 귀무가설 (
) 이 채택된다면 그것은 무슨 뜻일까? 그것은 당연히 모집단에서 두 변수 X, Y
사이에는 선형회귀모형이 존재하지 않는다는 뜻이다. 따라서 그러한 모집단으로부터
추출된 표본 자료에서 구한 표본회귀계수
은
의 추정량으로 아무런 의미가 없다. 즉,
은
의 추정량으로 유의성이 없는 것이다. 그러므로 표본회귀계수 (
) 의 유의성 검정에서 귀무가설 (
) 과 대립가설 (
) 은 식 8 로 설정한다.
|
|
식 8 |
그러면 식 8 로 설정된
가설을 검정하기 위해서 사용하는 검정통계량은 무엇인가? 먼저 표본회귀계수 (
) 가 갖는 표본분포의 성격을 알아야 한다. 모집단으로부터 크기가 동일한 표본은
무수히 많이 뽑을 수 있다. 그런데 각 표본으로부터 최소자승법으로 회귀계수 (
) 를 구하면
은 일정한 값으로 나타나지 않고 변하는 확률변수이다. 그러면
는 어떠한 확률분포를 갖게 될 것인가? 당연히
는 평균이
이고 분산이
이며 정규분포를 따를 것이다. 여기서 분산에 대하여 제곱근을 취한 값이
의 표준오차
이다. 그런데
의 표준오차는 구할 수 없다. 왜냐하면 교란항 분산
은 알 수 없기 때문이다. 그러므로
의 추정치를 잔차의 제곱 합으로 구할 수밖에 없다.
에 대한 추정치를
로 표기하고,
은 식 17 로부터 구할 수 있다.
이제 가설을 검정하기
위한 검정통계량은 어떻게 구할 수 있는지 살펴보자. 표본회귀계수
는 평균이
이고 분산이
이며 정규분포한다. 그러나 교란항 분산
은 알려져 있지 않으므로 대신 잔차로부터 추정한
를 사용한다. 그러므로 표본회귀계수
의 유의성 검정을 위해 사용되는 검정통계량은 식 9 로 정의된다.
|
|
식 9 |
(예제 2) 앞장 예제
10.1 에서 최소자승법으로 구한 표본회귀계수
는 0.700 이다. 그리고 n = 5 이고,
= 0.0577 이다. 그러면 표본회귀계수
= 0.700 은 과연 모회귀계수
에 대하여 유의성이 있는 추정량인가?
(풀이 2)
가 유의성 있는 추정량인가를 밝히기 위해서는 가설 검정 절차에 따라 풀이하도록
한다.
첫째, 가설을 설정한다.
의 유의성 검정을 실행하기 위해서는 식 8 과 같이 가설을 설정한다.

둘째, 유의수준 α 를 결정한다.
유의수준이란 제 1 종의 오류를 의미하여 α 로 표기하고 일반적으로 5 % 를 기준으로 한다.
셋째, 검정통계량 (t*) 를 구한다.
표본 자료로부터 구한
통계량으로
를 기준으로 검정통계량을 구한다. n = 5,
= 0.700,
= 0.0577 이므로 검정통계량 (t*) 은 식 9 를 이용하여 쉽게 구할
수 있다.

넷째, 검정통계량 (t*)
을 임계치 (
) 와 비교하여 가설을 검정한다.
식 9 로부터 구한 검정통계량
(t*) 은 자유도가 3 (= n - 2) 인 t 분포하므로 t 분포의 임계치 (
) 와 비교하여 검정한다. 자유도가 3 인 t 분포에서 임계치는 그림 2 로 나타난다.
검정통계량 t*
= 12.132 는 임계치
= 3.182 와 비교하면 t* 는
기각영역에 위치한다. 그러므로 귀무가설 (
) 를 기각한다.

그림 2 자유도가 3 인 t 분포에서 임계치
다섯째, 가설검정 결과를 해석한다.
를 기각하므로
라는 가설은 타당한 근거가 될 수 없다. 그러므로
라는
을 채택하게 되어 표본회귀계수
은 유의성이 있는 추정량이다.
회귀모형은 독립변수와 종속변수 사이에 관련성이 있을 때 존재할 수 있다. 그러면 관련성 정도는 어떻게 측량할 수 있을까?
두 변수 사이에 존재하는 관련성 정도를 측량하는 단위가 상관계수 (correlation coefficient) 이다. 회귀분석에서 독립변수는 주어진 값으로 종속변수는 확률변수로 가정한다. 그러나 상관계수는 두 변수 X, Y 가 모두 확률변수로 가정한다. 모집단에서 두 변수 X, Y 의 상관계수는 ρ (rho) 로 표기하고 식 10 으로 정의한다.
|
모집단에서
상관계수 : cov(X,
Y) ; 공분산, |
식 10 |
그리고 표본 자료에서 존재하는 두 변수 X, Y 의 상관계수는 r 로 표기하고 식 11 로 계산한다.
상관계수는 두 변수의 공분산을 각 변수의 표준편차로 나누어 계산한다. 그러므로 두 변수의 공분산이 갖는 부호에 의해서 상관계수의 부호가 결정된다.
|
표본 상관계수
: |
식 11 |
공분산 (covariance)
이란 두 변수 X, Y 가 공통으로 변화하는 변량의 크기를 의미한다. 식 11 에서 나타난
바와 같이 두 변수 X, Y 의 공분산은
로 계산한다.
X 가 큰 값을 가질 때 Y 도 큰 값을 갖게되면 공분산 부호는 양 (+) 의 값을 갖는다. 그런데 X 가 큰 값을 가질 때 Y 는 작은 값을 갖게되면 공분산 부호는 음 (-) 의 값을 갖고, 상관계수는 음 (-) 의 값을 갖는다. 상관계수 (r) 의 특성은 다음과 같다.
첫째, 상관계수의 부호는 두 변수의 공분산 부호에 의하여 결정된다.
공분산이 양 (+) 의 값을 가지면 상관계수의 부호는 양 (+) 이고, 공분산이 음 (-) 이 값을 가지면 상관계수의 부호는 음 (-) 이다.
둘째, 상관계수는 -1 에서 +1 사이에 값을 갖는다. (-1 ≤ r ≤ 1).
상관계수는 두 변수 사이에 존재하는 관련성 정도를 나타내므로, 그 값이 ±1 에 접근하면 매우 밀접한 관계를, 0 에 접근하면 관련성이 거의 없다는 뜻이다.
셋째, 두 변수 X, Y 가 서로 통계적 독립이라면 상관계수 값은 0 이다.
두 변수 사이에 아무런 관련성이 없으면 r = 0 이다. 그러나 그 역의 표현은 성립하지 않는다. 상관계수가 0 일지라도 두 변수 X, Y 는 서로 독립이 아닐 수도 있다. 그림 10-11 은 r = 0 이지만 두 변수 X Y 가 매우 밀접한 관련성이 있음을 보여주고 있다.
다시 설명하면 상관계수는 두 변수가 선형 관계로 표시되는 관련성 정도를 의미한다. 그러므로 비선형 관계로 관련성을 맺고 있는 경우에는 상관계수에서는 관련성이 나타나지 않는다. 따라서 그림 3 과 같이 두 변수가 비선형 관계로 관련성이 있다면, 그때에 상관계수는 관련성의 정도를 측량하는 단위로는 아무런 의미가 없다.

그림 3 r = 0 이지만 두 변수가 밀접한 관계가 있는 경우
넷째, 상관계수는 한 변수가 다른 변수에 영향을 미치는 크기를 나타내지 않는다.
상관계수는 두 변수 사이에 존재하는 관련성의 정도를 측량할 뿐이고, 한 변수가 다른 변수에 영향을 미치는 크기를 나타내는 단위가 아니다.
다섯째, 두 변수 X,
Y 의 상관계수가
일 때 X 와 Y 에 의해서 각각 선형으로 변환된 새로운 변수의 상관계수는
본래 상관계수 (
) 와 같다.
두 변수 X, Y 에 의해서
선형관계로 변환된 새로운 변수를 각각
라 하자 (b > 0, d > 0). 그러면
의 상관계수는 본래 X, Y 의 상관계수 (
) 와 같다.
어떤 모집단에서 두 변수 X 와 Y 의 상관계수를 ρ 라 하자. 그러한 모집단으로부터 크기 (n) 가 동일한 표본은 무수히 추출할 수 있다. 그러면 각 표본에서 구한 두 변수 X, Y 의 상관계수 r 은 일정한 값을 갖지 않고 변하는 확률변수이다. 그러나 모상관계수 ρ 는 유일한 값으로 존재한다. 그러므로 많은 상관분석에서는 표본상관계수보다 모상관계수에 더 관심을 둔다. 그런데 모상관계수 (ρ) 는 알려져 있지 않으므로 표본상관계수 (r) 가 ρ 에 대한 추정량으로 사용한다. 따라서 표본자료로부터 구한 상관계수는 유의성이 있는지 없는지 검정해야 한다. 다음 예제 3 으로부터 상관계수의 유의성에 대하여 풀이하도록 하자.
(예제 3) 어떤 작업장 관리자는 근로자들의 혈압과 생산성 사이에는 밀접한 상관관계가 있다고 주장한다. 과연 그러한 주장은 유의성이 있는 것일까?
그 작업장에서 일하는 많은 근로자 가운데서 18 명을 표본으로 추출하여 혈압과 생산성 사이에 상관계수 (r) 를 구한 결과 -0.39 이다. 그렇다면 혈압과 생산성 사이에는 상관관계가 존재한다는 주장은 유의성이 있는가?
(풀이 3) 전체 근로자 집단에서 혈압과 생산성 사이에 상관계수를 ρ 라 하자. 그런데 ρ = 0 인 경우에 표본상관계수 (r) 가 -0.39 로 나타날 수도 있다.
이러한 경우에 r = -0.39 는 아무런 의미가 없다. 표본에서만 나타난 상관관계이므로 유의성이 없는 것이다. 그러므로 ρ = 0 인지 아닌지 가설 검정해야 한다.
첫째, 가설을 설정한다.
모집단에서 상관관계가 없다는 귀무가설과 상관관계가 존재한다는 대립가설로 설정하여 기호로 표현하면 다음과 같다.

둘째, 유의수준을 결정한다.
일반적인 기준으로 유의수준 (α) 을 0.05 로 하자. 대립가설의 형태에 따라 검정기준은 양측검정에 해당한다.
셋째, 표본상관계수로부터 검정통계량 (t*) 을 구한다.
전체 근로자 집단인 모집단으로부터 크기 (n) 가 동일한 표본은 무수히 많이 추출할 수 있다. 그런데 각 표본 자료로부터 구한 표본 상관계수 (r) 는 일정한 값을 갖지 않고 변한다. 그러면 각 표본에서 구한 r 은 어떠한 확률분포로 나타날 것인가. 표본상관계수를 식 12 로 변환하면 변환된 확률변수 t 는 자유도가 n - 2 인 t 분포한다.
|
검정통계량
: |
식 12 |
표본 자료에서 r = -0.39, n = 18 이므로 식 12 를 이용하여 검정통계량 (t*) 을 쉽게 구할 수 있다.

넷째, 이론적인 t 분포에서 임계치 () 와 검정통계량 (t*) 을 비교하여 검정한다.
자유도가 16(= n -
2) 인 t 분포에서 임계치와
기각영역은 그림 4 와 같다. 따라서 검정통계량 (t* = -1.696) 을
임계치 (
= -2.120) 와 비교하면
채택영역에 위치하므로 귀무가설 (
) 를 채택하게 된다.

그림 4 자유도가 16 인 t 분포와 임계치
다섯째, 검정결과를 해석한다.
가설 검정 결과 5 %
유의수준에서 귀무가설 (
) 를 채택하므로 표본에서 구한 상관계수 (r) 는 유의성이 없다. 즉 표본상관계수
(r = -0.39) 는 의미가 없다.
이제까지 설명한 회귀모형은 모두 상수항이 포함된 직선 형태의 선형회귀모형만을 다루었다. 그런데 경제이론과 실제 경제현상에서 나타나는 여러 함수관계는 선형이 아니라 비선형모형으로 설명되는 경우가 많다. 그러면 회귀모형이 선형이 아니라 비선형이라면 최소자승법을 적용하여 회귀분석할 수 없는가?
그렇지는 않다. 비선형모형을 적절하게 변수 변환하여 선형으로 접근시켜 회귀분석할 수 있다. 예를 들면 평균 고정비용함수 (AFC), Phillips 곡선, 엥겔지출곡선 등은 그림 5 와 같은 표본 자료성격으로 나타난다.

그림 5 역변환 회귀모형
그림 5 와 같은 산포도를 갖는 회귀모형은 식 13 과 같이 역변환 회귀모형으로 설정할 수 있다.
|
역변환
회귀모형
: |
식 13 |
선형회귀모형에서 모회귀계수
는 독립변수 X 의 절대적 변화 크기 (
) 에 대한 종속변수 Y 의 절대적 변화 (
) 크기를 의미한다. 그러므로 독립변수의 상대적 변화나 변화율 및 탄력도 등에
대한 회귀모형으로 선형회귀모형은 적합하지 않다. 이러한 경우 종속변수나 독립변수에
로그 (log) 를 취하여 변수 변환한 회귀모형을 설정할 수 있다.