用PyPDF2提取PDF文件的文本

第3节课介绍了用用PDF plumber包提取PDF文件中的文本,这里介绍用PyPDF2包进行提取。

首先用PdfReader类的构造函数打开PDF文件,得到一个PdfReader对象。接下来用这个对象的_get_page方法,指定页的索引号,得到对应的页,然后利用这个页对象的extract_text方法提取文本。

代码如下所示。

code.python
>>> from PyPDF2 import PdfReader
>>> pdf_reader=PdfReader('D:\\test.pdf')
>>> 
>>> pg0=pdf_reader._get_page(0)
>>> txt=pg0.extract_text()