python 使用pdfminer3k 讀取PDF文檔的例子

更新時間：2019年08月27日 11:23:42 作者：彭世瑜

今天小編就為大家分享一篇python 使用pdfminer3k 讀取PDF文檔的例子，具有很好的參考價值，希望對大家有所幫助。一起跟隨小編過來看看吧

1、安裝 pdfminer3k

通過pip安裝: pip install pdfminer3k

下載安裝：在網(wǎng)頁 https://pypi.org/project/pdfminer3k/1.3.1/#files 進行下載，解壓。然后cmd命令進入到當前文件夾：

可以直接在資源管理器的路徑欄直接輸入cmd進入到當前目錄。然后執(zhí)行 python setup.py install 等待安裝完成

2.讀取pdf中的TXT代碼示例：

from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LAParams
from pdfminer.pdfparser import PDFParser, PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.pdfdevice import PDFDevice

# 可以使用此方法獲取網(wǎng)絡上的pdf
from urllib.request import urlopen
fp = urlopen("https://******/articles/800348152163.pdf")

#獲取文檔對象
#fp = open("****.pdf", "rb")

#創(chuàng)建一個一個與文檔關聯(lián)的解釋器
parser = PDFParser(fp)

#PDF文檔的對象
doc = PDFDocument()

#連接解釋器和文檔對象
parser.set_document(doc)
doc.set_parser(parser)

#初始化文檔,當前文檔沒有密碼，設為空字符串
doc.initialize("")

#創(chuàng)建PDF資源管理器
resource = PDFResourceManager()

#參數(shù)分析器
laparam = LAParams()

#創(chuàng)建一個聚合器
device = PDFPageAggregator(resource, laparams=laparam)

#創(chuàng)建PDF頁面解釋器
interpreter = PDFPageInterpreter(resource, device)

#使用文檔對象得到頁面的集合
for page in doc.get_pages():
 # 使用頁面解釋器讀取
 interpreter.process_page(page)

 # 使用聚合器來獲得內(nèi)容
 layout = device.get_result()

 for out in layout:
  if hasattr(out, "get_text"):
   print(out.get_text())

以上這篇python 使用pdfminer3k 讀取PDF文檔的例子就是小編分享給大家的全部內(nèi)容了，希望能給大家一個參考，也希望大家多多支持腳本之家。

您可能感興趣的文章:

Python爬蟲Scrapy框架IP代理的配置與調(diào)試
在調(diào)試爬蟲的時候，新手都會遇到關于ip的錯誤，本文就來介紹一下Python爬蟲Scrapy框架IP代理的配置與調(diào)試，具有一定的參考價值，感興趣的可以了解一下
2021-12-12
python中numpy數(shù)組的csv文件寫入與讀取
本文主要介紹了python中numpy數(shù)組的csv文件寫入與讀取，文中通過示例代碼介紹的非常詳細，對大家的學習或者工作具有一定的參考學習價值，需要的朋友們下面隨著小編來一起學習學習吧
2023-03-03
linux 下selenium chrome使用詳解
這篇文章主要介紹了linux 下selenium chrome使用詳解,文中通過示例代碼介紹的非常詳細，對大家的學習或者工作具有一定的參考學習價值，需要的朋友們下面隨著小編來一起學習學習吧
2020-04-04
Python實現(xiàn)某論壇自動簽到功能
這篇文章主要介紹了Python實現(xiàn)論壇自動簽到功能，本文通過實例代碼給大家介紹的非常詳細，具有一定的參考借鑒價值,需要的朋友可以參考下
2019-08-08
Python實現(xiàn)隨機生成任意數(shù)量車牌號
這篇文章主要介紹了Python實現(xiàn)隨機生成任意數(shù)量車牌號，本文通過實例代碼給大家介紹的非常詳細，具有一定的參考借鑒價值,需要的朋友可以參考下
2020-01-01
Python九九乘法表的七種實現(xiàn)方式詳解
在Python中,輸出九九乘法表是一道非?；A的題目,但對于初學者來說,也是一個很好的練習和鞏固基礎知識的機會,這篇文章主要給大家介紹了關于Python九九乘法表的七種實現(xiàn)方式,需要的朋友可以參考下
2023-09-09
pytorch fine-tune 預訓練的模型操作
這篇文章主要介紹了pytorch fine-tune 預訓練的模型操作，具有很好的參考價值，希望對大家有所幫助。如有錯誤或未考慮完全的地方，望不吝賜教
2021-06-06
手把手教你進行Python虛擬環(huán)境配置教程
這篇文章主要介紹了手把手教你進行Python虛擬環(huán)境配置,本文給大家介紹的非常詳細，具有一定的參考借鑒價值，需要的朋友參考下吧，需要的朋友可以參考下
2020-02-02
Python中獲取秒級時間戳的實踐指南
在計算機編程中,時間戳是一個非常重要的概念,它表示自?1970?年?1?月?1?日（UTC）以來經(jīng)過的秒數(shù),在?Python?中,獲取當前時間的時間戳是一項常見的任務,尤其是在處理日志、數(shù)據(jù)庫時間戳或者需要時間同步的場景中,本文介紹了Python中獲取秒級時間戳的實踐指南
2024-12-12
numpy求解線性代數(shù)相關問題
本文主要介紹了numpy求解線性代數(shù)相關問題,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
2025-01-01