OALib Journal期刊
ISSN: 2333-9721
费用：99美元

投递稿件

查看量	下载量

相关文章
更多...

重庆大学学报 2010

面向文本知识管理的自适应中文分词算法

DOI: 10.11835/j.issn.1000-582X.2010.10.019

冯永,贺迅,唐黎,陈显勇,陈贞

Keywords: 知识管理,文本处理,统计方法,自适应算法

Full-Text Cite this paper Add to My Lib

Abstract:

针对传统字典匹配分词法在识别新词和特殊词处理方面的不足,结合2元统计模型提出了面向文本知识管理的自适应中文分词算法——SACWSA.SACWSA在预处理阶段结合应用有限状态机理论、基于连词的分隔方法和分治策略对输入文本进行子句划分,从而有效降低了分词算法的复杂度;在分词阶段应用2元统计模型,结合局部概率和全局概率,完成子句的切分,从而有效地提升了新词的识别率并消除了歧义;在后处理阶段,通过建立词性搭配规则来进一步消除2元分词结果的歧义.SACWSA主要的特色在于利用“分而治之”的思想来处理长句和长词,用局部概率与全局概率相结合来识别生词和消歧.通过在不同领域语料库的实验表明,SACWSA能准确、高效地自动适应不同行业领域的文本知识管理要求.

Full-Text

Contact Us

service@oalib.com

QQ:3279437679

WhatsApp +8615387084133