第3节课介绍了用用PDF plumber包提取PDF文件中的文本,这里介绍用PyPDF2包进行提取。
首先用PdfReader类的构造函数打开PDF文件,得到一个PdfReader对象。接下来用这个对象的_get_page方法,指定页的索引号,得到对应的页,然后利用这个页对象的extract_text方法提取文本。
代码如下所示。
code.python
>>> from PyPDF2 import PdfReader
>>> pdf_reader=PdfReader('D:\\test.pdf')
>>>
>>> pg0=pdf_reader._get_page(0)
>>> txt=pg0.extract_text()