%0 Journal Article %T 网页正文信息抽取新方法 %A 宋明秋 %A 张瑞雪 %A 吴新涛 %A 李文立 %J 大连理工大学学报 %P 594-597 %D 2009 %R 10.7511/dllgxb200904022 %X 基于包装器的信息抽取方法只能处理一种特定的信息源,而且对网页结构的依赖性强.基于此提出了一种将中文标点符号和HTML树结构作为识别网页正文内容重要特征的网页分析方法,通过统计中文标点符号确定部分正文信息,然后根据正文信息在结构上的相似性确定其他正文信息内容.实验结果表明该方法能有效地剔除网页噪音并提取网页正文,具有较好的通用性和较高的准确性. %K 包装器 %K HTML树 %K 网页信息提取 %U http://press.dlut.edu.cn/ch/reader/view_abstract.aspx?file_no=20090422&flag=1