|
计算机科学 2007
基于页面标签的web结构化数据抽取Keywords: web数据抽取web挖掘结构化数据信息抽取 Abstract: 本文研究了从dataintensive类型的web页面中提取结构化数据的问题,提出了基于页面标签的数据抽取算法。该算法先根据标签的显示位置及其大小判断不同标签元素之间的嵌套关系,并构造简化的html树sim-htree,有效地减少了识别数据记录的时间。在此基础上,提出子串匹配调整算法,对数据记录进行识别,标识数据项。实验表明,该算法是有效的。
|