下面使用PDF plumber包,从一个指定的PDF文件里面提取文本。
提取文本需要调用page对象的extract_text方法。提取整个PDF文件里所有的文本,可以遍历所有的页,对每一页执行提取操作,最后用txt = txt + 单页文本这样的方式把前后提取的内容连接起来,把所有文本串起来放在一个字符串里。
下面的代码首先打开D盘下的test.pdf文件,然后提取第1页,返回到pg1对象,利用该对象的extract_text方法提取第1页中的文本。
code.python
>>> import pdfplumber as pp
>>> pdf=pp.open('D:\\test.pdf')
>>> pg1=pdf.pages[0]
>>> txt=pg1.extract_text()
下面的代码遍历文件中的所有页,提取每个页中的文本并将它们合并后返回。
code.python
>>> for pg in pdf.pages:
txt=txt+pg.extract_text()