|
- 2018
结合语义和结构的短文本相似度计算DOI: 10.3969/ j. issn.1673-629X.2018.08.022 Keywords: EMD, Word2Vec, 短文本相似度计算, 语义相似度, 词序结构 Abstract: 短文本相似度不仅包括语义相似度,还包括语法相似度。 目前在短文本相似度度量算法中,大多只分析短文本语义层次的相似性,往往忽略了短文本的语法结构对短文本相似度的重要影响,导致无法捕获大量的文本语义信息,同时在短文本分类任务中召回率不够理想。 通过分析短文本的特征,将 EMD(earth mover’s distance)求解线性规划中运输问题的最优解应用于度量两个短文本的相似度,用 Word2Vec 度量两个单词的语义相似性,提出了词序位置相似度的概念,即在计算短文本相似度的同时考虑语句词组顺序对相似度的贡献。 实验结果表明,在捕获大量文本语义信息的基础上,将算法应用于 k 近邻(k-nearest neighbor,KNN)文本分类中,有较好的准确率和召回率
|