全部 标题 作者
关键词 摘要

OALib Journal期刊
ISSN: 2333-9721
费用:99美元

查看量下载量

相关文章

更多...
软件学报  2013 

基于条件随机场方法的开放领域新词发现

DOI: 10.3724/SP.J.1001.2013.04254, PP. 1051-1060

Keywords: 新词发现,condition,random,field(crf),中文分词

Full-Text   Cite this paper   Add to My Lib

Abstract:

开放领域新词发现研究对于中文自然语言处理的性能提升有着重要的意义.利用条件随机场(conditionrandomfield,简称crf)可对序列输入标注的特点,将新词发现问题转化为预测已分词词语边界是否为新词边界的问题.在对海量规模中文互联网语料进行分析挖掘的基础上,提出了一系列区分新词边界的统计特征,并采用crf方法综合这些特征实现了开放领域新词发现的算法,同时比较了k-means聚类、等频率、基于信息增益这3种离散化方法对新词发现结果的影响.通过在sogout大规模中文语料库上的新词发现实验,验证了所提出的方法有较好的效果.

Full-Text

Contact Us

service@oalib.com

QQ:3279437679

WhatsApp +8615387084133