中国科学院机构知识库网格
Chinese Academy of Sciences Institutional Repositories Grid
基于自动机理论的PDF文本内容抽取

文献类型:期刊论文

作者王晓娟2; 谭建龙3; 刘燕兵1; 刘金刚2
刊名计算机应用
出版日期2012
卷号32.0期号:009页码:2491
关键词文本内容抽取 自动机 确定的有穷自动机 不完整文档
ISSN号1001-9081
英文摘要现有的从PDF文档抽取文本内容的方法(如PDFBox类库采用的方法)处理速度较低,无法满足高速网络中内容分析的需求,也不能对网络中部分到达的PDF数据包进行流式的处理。为此,提出了基于自动机理论的PDF文本内容抽取方法。该方法通过建立具有层次的关键字自动机,可以快速地抽取完整PDF文档和不完整PDF文档中的文本内容。在中文和英文PDF文档数据集下的实验结果表明,基于自动机理论的PDF文本内容抽取方法耗时仅为PDFBox方法的17%~37%。
语种英语
源URL[http://119.78.100.204/handle/2XEOYT63/34955]  
专题中国科学院计算技术研究所期刊论文_中文
作者单位1.中国科学院大学
2.首都师范大学
3.中国科学院计算技术研究所
推荐引用方式
GB/T 7714
王晓娟,谭建龙,刘燕兵,等. 基于自动机理论的PDF文本内容抽取[J]. 计算机应用,2012,32.0(009):2491.
APA 王晓娟,谭建龙,刘燕兵,&刘金刚.(2012).基于自动机理论的PDF文本内容抽取.计算机应用,32.0(009),2491.
MLA 王晓娟,et al."基于自动机理论的PDF文本内容抽取".计算机应用 32.0.009(2012):2491.

入库方式: OAI收割

来源:计算技术研究所

浏览0
下载0
收藏0
其他版本

除非特别说明,本系统中所有内容都受版权保护,并保留所有权利。