OALib Journal期刊
ISSN: 2333-9721
费用：99美元

投递稿件

查看量	下载量

相关文章
更多...

计算机应用 2012

基于自动机理论的pdf文本内容抽取

王晓娟,*,谭建龙,刘燕兵,刘金刚

Keywords: 文本内容抽取,自动机,确定的有穷自动机,不完整文档

Full-Text Cite this paper Add to My Lib

Abstract:

？现有的从pdf文档抽取文本内容的方法(如pdfbox类库采用的方法)处理速度较低,无法满足高速网络中内容分析的需求,也不能对网络中部分到达的pdf数据包进行流式的处理。为此,提出了基于自动机理论的pdf文本内容抽取方法。该方法通过建立具有层次的关键字自动机,可以快速地抽取完整pdf文档和不完整pdf文档中的文本内容。在中文和英文pdf文档数据集下的实验结果表明,基于自动机理论的pdf文本内容抽取方法耗时仅为pdfbox方法的17%~37%。

Full-Text

Contact Us

service@oalib.com

QQ:3279437679

WhatsApp +8615387084133