Corpus Linguistics

 

.......... 한국어로는 '말뭉치' 혹은 '말모둠'으로 번역하는, 코퍼스(corpus)는 글 또는 말 텍스트를 모아 놓은 것이다. 다양한 종류의 텍스트를 모아 놓은 성경은 이러한 넓은 의미에서 일종의 코퍼스이다. 혹은 셰익스피어의 저작들을 모아 놓은 것도 셰익스피어 코퍼스이다. 그러나 좀더 좁은 의미에서 코퍼스언어학의 코퍼스는 다음과 같은 기준을 만족하는 텍스트의 집합을 말한다. 우선, 코퍼스는 언어 연구를 염두에 두고 구축된다. 따라서, 코퍼스의 텍스트들은 언어 연구를 위한 어떤 기준에 의해 선택된다--현대 한국어 일반을 대표하는 코퍼스, 신문 기사 코퍼스, 일상 대화 코퍼스, 여성 작가의 소설 코퍼스 등. 그리고, 현대의 코퍼스언어학에서 말하는 코퍼스는 컴퓨터에 저장하고 컴퓨터에서 처리할 수 있는 형태의, 전자화된 텍스트, 즉 비트로 구성된 것을 말한다.

말뭉치 언어학 (Corpus Linguistics) 은 이러한 (전자) 코퍼스를 바탕으로 컴퓨터를 이용하여 언어학적 연구를 수행하는 언어 연구의 방법이다. 전통적인 문법(문법론), 의미(의미론), 어휘(사전학)의 문제를 연구하는 동시에, 전자사전(electronic dictionary / computational lexicon), 어휘데이테베이스(lexical database), 통계적 자연언어처리(statistical NLP)  등의 연구 분야를 포함한다. .........

말뭉치란 문자 또는 음성 텍스트 모듬을 가리키는 말로서, 좁은 의미로 언어 연구를 염두에 두고 구축된 텍스트를 가리키는 말이다. 신문 기사 코퍼스, 일상 대화 코퍼스, 여류 소설 코퍼스 등이 그 예이다. 아울러 말뭉치는 컴퓨터에 저장하고 컴퓨터에서 처리할 수 있는 형태의 전자화된 텍스트를 가리킨다. 즉 말뭉치 언어학은 이러한 전자 말뭉치를 바탕으로 컴퓨터를 이용하여 언어학적 연구를 수행하는 언어 연구의 방법이다. 전통적인 문법, 의미, 어휘의 문제를 연구하는 동시에, 전자사전, 어휘데이테베이스, 통계적 자연언어처리 등의 연구 분야를 포함한다.

말뭉치 언어학은 말뭉치를 기반으로 한 언어학의 한 분야로서, 1950년대 등장한 미국의 실증주의-행동주의적 구조주의 언어학자들이 실제 언어자료를 언어학의 일차적인 설명 대상으로 삼아 출발한다. 그러나 실질적인 말뭉치 언어학의 출발은 1959년 더럼(Durham) 대학, 1960년 런던 대학에서 영어 용법 조사 말뭉치(Survey of English Usage Corpus)라는 이름으로 영어의 실제 쓰임을 광범위하게 조사하기 시작한 데서부터 비롯되며, 말뭉치 연구가 본격화된 것은 브라운 대학의 프랜시스(W. N. Francis)와 쿠체라(Kucera)가 20종에 걸친 총 500편의 글에서 2000 마디씩 뽑아 총 100만 마디의 말뭉치를 구축하고 컴퓨터를 이용하여 분석한 이후부터라고 할 수 있다. ............ (언어학사전 : 김형주의 글말닷컴)

term :

언어학 (Linguistics)   인공지능 (Artificial Intelligence)    자연어처리 (Natural Language Processing)   말뭉치 (Corpus)

site :

computational corpus linguistics : 강범모, 고려대 언어과학과

CETConc : 고려대 민족문화연구원 전자텍스트연구소 용례추출기