Tagging
자연언어는 어휘, 구문, 의미 수준에서 본질적으로 많은 중의성(ambiguity)을 가지고 있다. 따라서 가공되지 않은 원시 말뭉치(corpus)를 그대로 사용할 때는 중의성으로 인하여 정확한 언어 정보를 추출하여 이용하는데 어려움이 있다. 하지만 원시 말뭉치에서 중의성을 해소하여 부가적인 언어 정보를 부착하면 이러한 어려운 점을 극복할 수 있다. 이때 부가된 언어 정보를 태그(tag) 라고 하고, 이렇게 태그가 부착된 말뭉치를 태그 부착 말뭉치(tagged corpus)라고 한다. 그리고 이와같이 태그를 부착하는 작업을 태깅(tagging)이라고 하며, 태깅을 수행하는 컴퓨터 프로그램을 태거(tagger)라고 한다.
kaist 국어정보 베이스 : 태깅을 하게 된 배경은 언어 자료의 수집과 이를 이용하기 위한 기초 분석에 있습니다. 언어를 분석하는 기초 도구로는 형태소 분석기, 용례 분석기, 태거, 구분트리 태거 등이 있으며 이 중에서 태거의 역할은 상당히 중요합니다. 대량의 말뭉치를 태깅하여 얻은 태깅된 말뭉치는 단어의 분포, 인접 단어 정보, 품사 n-gram 등을 비롯한 유용한 정보를 제공하며, 구문 해석기 등의 시스템에서 test 문서로 이용됩니다......태깅 시스템의 다른 용도로는 구문 해석기의 전처리기나 문자 인식의 후처리기로 사용되는 경우를 들 수 있습니다. 구문 해석기의 입력, 즉 형태소 해석의 결과가 중의성을 가진다면 구문 해석기는 필요 없는 품사들에 대한 구문트리를 만들기 위해 상당히 많은 시간이 걸리게 되는데, 태거를 전처리기로 사용한다면 시간을 절약할 수 있고 좋은 결과를 낼 수 있습니다.......본 연구에서는 통계적인 처리의 일환으로 은닉 마르코프 모델(Hidden Markov Model)을 기본 모델로 하였고 어절 관계와 형태소 관계를 동시에 은닉 마르코프 모델에 반영하여 태깅의 정확도를 높인 모델을 이용하여 한 국어 태깅 시스템을 구축하였습니다......지금까지 구현된 태깅 시스템은 규칙을 이용하는 방법과 확률을 이용하는 방법으로 나눌 수 있고 이외에도 신경망을 이용하는 방법과 퍼지망을 이용하는 방법도 있지만 크게 확률을 이용하는 방법으로 볼 수 있습니다.....규칙을 이용한 방법은 태깅 연구의 초기 단계에 주로 개발되었던 방식으로서, 이 방법은 규칙을 만들기 어렵고, 견고성이 없고 규칙의 일관성을 유지하기 어렵다는 문제를 가지고 있습니다. 그러나, 태깅을 위해 필요한 규칙의 수가 적고, 시스템의 성능 향상을 쉽게 꾀할 수 있으며, 다른 태그 집합, 다른 유형의 말뭉치, 다른 언어에 쉽게 적응할 수 있다는 장점도 있습니다. 하지만 규칙 기술과 관리에 드는 수작업의 단점으로 인해 지금은 활발히 연구되고 있지는 않은 편입니다. 대표적인 시스템으로 TAGGIT 시스템 , Klein의 태깅 시스템, Hindle의 태깅 시스템 등을 들 수 있습니다....확률을 이용하는 방법은 말뭉치에서 필요한 정보를 얻게 되므로 사람이 규 칙을 기술할 필요가 없고 대상 말뭉치에도 같은 엔진을 이용할 수 있다는 장점이 있지만 학습을 위한 대량의 말뭉치가 필요하다는 단점이 있습니다. 그러나 구축된 말뭉치는 다른 여러 분야에서도 유용한 기초 데이타가 되므로 말뭉치 구축 자체로도 큰 의미를 가질 수 있습니다. 대표적인 시스템으로 Charniak의 태깅 시스템, Kupiec의 태깅 시스템, Benello의 신경망을 이용한 태깅 시스템, 이운재의 HMM/3 등을 들 수 있습니다.