全部 标题 作者
关键词 摘要

OALib Journal期刊
ISSN: 2333-9721
费用:99美元

查看量下载量

相关文章

更多...

基于改进互信息和邻接熵的微博新词发现方法

DOI: 10.11772/j.issn.1001-9081.2016.10.2772

Keywords: 新词发现,多字词,N-Gram,互信息,邻接熵

Full-Text   Cite this paper   Add to My Lib

Abstract:

摘要 针对目前微博新词发现算法中的数据稀疏、可移植性较差以及缺乏对多字词(大于三字)识别的问题,提出了基于改进互信息(MI)和邻接熵(BE)的微博新词发现算法——MBN-Gram。首先,利用N元递增算法(N-Gram)提取新词的候选项,对提取出来的候选新词使用频率和停用字等规则进行过滤;接着再利用改进MI和BE对候选项进行扩展及再过滤;最后,结合相应词典进行筛选,从而得到新词。通过理论及实验分析,MBN-Gram算法在准确率、召回率及F值上均有一定提高。实验结果表明,MBN-Gram算法是有效可行的

Full-Text

Contact Us

service@oalib.com

QQ:3279437679

WhatsApp +8615387084133