OALib Journal期刊
ISSN: 2333-9721
费用：99美元

投递稿件

查看量	下载量

相关文章
更多...

大连理工大学学报 2009

网页正文信息抽取新方法

DOI: 10.7511/dllgxb200904022, PP. 594-597

宋明秋,张瑞雪,吴新涛,李文立

Keywords: 包装器,HTML树,网页信息提取

Full-Text Cite this paper Add to My Lib

Abstract:

基于包装器的信息抽取方法只能处理一种特定的信息源，而且对网页结构的依赖性强．基于此提出了一种将中文标点符号和HTML树结构作为识别网页正文内容重要特征的网页分析方法，通过统计中文标点符号确定部分正文信息，然后根据正文信息在结构上的相似性确定其他正文信息内容．实验结果表明该方法能有效地剔除网页噪音并提取网页正文，具有较好的通用性和较高的准确性．

Full-Text

Contact Us

service@oalib.com

QQ:3279437679

WhatsApp +8615387084133