2013년 8월 26일 월요일

mecab-ko-dic-1.4.2-20130825 배포합니다.

mecab-ko-dic-1.4.2-20130825이 나왔습니다.
  • 단어 끝에 숫자가 붙은 잘못된 의존명사(NNB) 제거
  • 한글로 이루어진 모르는 단어에 대해 'NN'에서 'UNKNOWN'으로 표기하는 것으로 변경
  • '저거나'가 '저/VV+거나/EC'로 오분석되는 것을 막기 위해 '저거'(저것/NP+이/VCP)의 단어 출현 비용 낮춤
여기서 받으실 수 있습니다.

2013년 8월 23일 금요일

mecab-ko-dic-1.4.1-20130823 배포합니다.

mecab-ko-dic-1.4.1-20130823이 나왔습니다.
  • 의존 명사(NNB)에 관한 분석 규칙 변경
  • 접두어 '명'('이름난', '뛰어난'의 뜻을 가지는) 추가
  • 몇몇 단어와 기분석 사전 추가
여기서 받으실 수 있습니다.

2013년 8월 7일 수요일

ElasticSearch 플러그인을 만드는 중입니다.

mecab-ko-lucene-analyzerElasticSearch 플러그인을 만드는 중입니다. mecab-ko-lucene-analyer의 dev-elasticsearch-analyzer 브랜치로 작업 중이며, 아직 정식으로 릴리스할 정도는 아니라고 판단되어, 베타 테스트로 설치할 수 있는 방법을 공유합니다.

아래의 링크에서 자세한 설치와 사용 방법을 보실 수 있습니다.
https://bitbucket.org/eunjeon/mecab-ko-lucene-analyzer/raw/master/elasticsearch-analysis-mecab-ko/
현재는 tokenizer만 구현되어 있는 상태고, 제가 ElasticSearch에 경험이 없어서, 어떤 부분을 더 구현해야 할지 잘 모르는 상태입니다. 혹시 ElasticSearch를 사용하시는 분들은 테스트해 보시고, 버그나 더 구현해야 할 부분과 같은 간단한 피드백을 주시면 매우 감사하겠습니다.

elasticsearch-0.90.2 기반으로 컴파일 했으며, elasticsearch-0.90.3에서 정상적으로 동작하는 것을 테스트 완료하였습니다.

2013년 7월 31일 수요일

리디북스에서 은전한닢 프로젝트를 사용합니다.



전자책 서비스인 리디북스의 책 검색에 은전한닢 프로젝트를 사용합니다. Apache Solr와 mecab-ko-lucene-analyzer를 사용하여 책과 저자 검색을 합니다.

2013년 7월 20일 토요일

mecab-ko-lucene-analyzer-0.12.0 배포합니다.

mecab-ko-lucene-analyzer-0.12.0이 나왔습니다.
  • mecab-ko-dic-1.4.0을 위한 코드 추가
여기서 받으실 수 있습니다.

mecab-ko-dic-1.4.0-20130720 배포합니다.

mecab-ko-dic-1.4.0-20130720이 나왔습니다.
  • 조사,어미,명사 파생 접미사 활용어 띄어쓰기 패널티를 주기위해 pos-id 변경 및 설정(dicrc) 변경
  • 인명사전(NN-Person.csv, NN-Person-Preanalysis.csv) 데이터 추가. (약 10만 단어 추가)
  • 안되/VV, 안된/VA+ETM, 안된다/VA+EF, 안된다는/VA+ETM 단어 출현 비용 수동으로 수정하여, 오분석 방지
  • 띄어쓰기 있는 어미 페널티 비용 500 -> 3000으로 변경
주의: mecab-ko-lucene-analyzer을 사용하시는 분들은 mecab-ko-lucene-analyzer-0.12.0으로 업데이트 하셔야합니다.

여기서 받으실 수 있습니다.

2013년 7월 7일 일요일

mecab-ko-lucene-analyzer-0.11.0 배포합니다.

mecab-ko-lucene-analyzer-0.11.0이 나왔습니다.
  • Apache Lucene/Solr 4.3.1 버전에 맞춰서 코드 수정.
주의: 이번 버전은 Lucene/Solr 4.3.x 버전을 사용하셔야 합니다.

여기서 받으실 수 있습니다.