- 단어 끝에 숫자가 붙은 잘못된 의존명사(NNB) 제거
- 한글로 이루어진 모르는 단어에 대해 'NN'에서 'UNKNOWN'으로 표기하는 것으로 변경
- '저거나'가 '저/VV+거나/EC'로 오분석되는 것을 막기 위해 '저거'(저것/NP+이/VCP)의 단어 출현 비용 낮춤
여기서 받으실 수 있습니다.
https://bitbucket.org/eunjeon/mecab-ko-lucene-analyzer/raw/master/elasticsearch-analysis-mecab-ko/현재는 tokenizer만 구현되어 있는 상태고, 제가 ElasticSearch에 경험이 없어서, 어떤 부분을 더 구현해야 할지 잘 모르는 상태입니다. 혹시 ElasticSearch를 사용하시는 분들은 테스트해 보시고, 버그나 더 구현해야 할 부분과 같은 간단한 피드백을 주시면 매우 감사하겠습니다.