全部 标题 作者
关键词 摘要

OALib Journal期刊
ISSN: 2333-9721
费用:99美元

查看量下载量

相关文章

更多...

自动抽取web数据的树对齐算法

, PP. 96-102

Keywords: 数据抽取,包装器,树对齐,数据抽取,包装器,树对齐

Full-Text   Cite this paper   Add to My Lib

Abstract:

针对从模板生成的网页中自动抽取web数据的问题,提出了一种新的树对齐算法.该算法能够确定输入网页的最大匹配结构.经过一系列的对齐操作之后,多棵树被合并成为一棵记录着合并前多个网页上的统计信息的合并树,树对齐算法可以发现合并树中的重复模式,在最可能内容块上构建包装器,并按照重复模式从网页上抽取数据.实验结果表明,该算法的抽取结果具有较高的准确性和良好的稳定性.

Full-Text

Contact Us

service@oalib.com

QQ:3279437679

WhatsApp +8615387084133