第一节：python提取PDF文档中的图片

由于项目需要将PDF文档当中的图片转换成图片，所以参考了这篇文章https://blog.csdn.net/qq_15969343/article/details/81673302后项目得以解决。

1、安装第三方类库pymupdf：pip install pymupdf

2、安装完成后直接上代码，代码如下：

import fitz

import time

import re

import os

def pdf2pic(path, pic_path):

    t0 = time.clock()                          # 生成图片初始时间

    checkXO = r"/Type(?= */XObject)"           # 使用正则表达式来查找图片

    checkIM = r"/Subtype(?= */Image)"

    doc = fitz.open(path)                      # 打开pdf文件

    imgcount = 0                               # 图片计数

    lenXREF = doc._getXrefLength()             # 获取对象数量长度

    # 打印PDF的信息

    print("文件名:{}, 页数: {}, 对象: {}".format(path, len(doc), lenXREF - 1))

    # 遍历每一个对象

    for i in range(1, lenXREF):

        text = doc._getXrefString(i)            # 定义对象字符串

        isXObject = re.search(checkXO, text)    # 使用正则表达式查看是否是对象

        isImage = re.search(checkIM, text)      # 使用正则表达式查看是否是图片

        if not isXObject or not isImage:        # 如果不是对象也不是图片，则continue

            continue

        imgcount += 1

        pix = fitz.Pixmap(doc, i)               # 生成图像对象

        new_name = "图片{}.png".format(imgcount) # 生成图片的名称

        if pix.n < 5:                           # 如果pix.n<5,可以直接存为PNG

            pix.writePNG(os.path.join(pic_path, new_name))

        else:                                   # 否则先转换CMYK

            pix0 = fitz.Pixmap(fitz.csRGB, pix)

            pix0.writePNG(os.path.join(pic_path, new_name))

            pix0 = None

        pix = None                              # 释放资源

        t1 = time.clock()                       # 图片完成时间

        print("运行时间:{}s".format(t1 - t0))

        print("提取了{}张图片".format(imgcount))

if __name__=='__main__':

    path = r"C:\Users\lenovo\Desktop\数据.pdf"

    pic_path = r'C:\Users\lenovo\Desktop\图片'

    # 创建保存图片的文件夹

    if os.path.exists(pic_path):

        print("文件夹已存在，不必重新创建！")

        pass

    else:

        os.mkdir(pic_path)

    pdf2pic(path, pic_path)

3、运行结果

文件名:C:\Users\lenovo\Desktop\数据.pdf, 页数: 51, 对象: 156

运行时间:1.0037559488187855s

提取了1张图片

运行时间:1.9240614402553362s

提取了2张图片

运行时间:2.8580821293209087s

提取了3张图片

运行时间:3.59311390384999s

提取了4张图片

运行时间:4.055301359322903s

提取了5张图片

运行时间:4.861761705280556s

第一节：python提取PDF文档中的图片的更多相关文章

C# 提取Word文档中的图片
C# 提取Word文档中的图片图片和文字是word文档中两种最常见的对象,在微软word中,如果我们想要提取出一个文档内的图片,只需要右击图片选择另存为然后命名保存就可以了,今天这篇文章主要是实现使 ...
Aspose.Words提取word文档中的图片文件
/// <summary> /// 提取word中的图片 /// </summary> /// <param name="filePath">w ...
如何使用免费PDF控件从PDF文档中提取文本和图片
如何使用免费PDF控件从PDF文档中提取文本和图片概要现在手头的项目有一个需求是从PDF文档中提取文本和图片,我以前也使用过像iTextSharp, PDFBox 这些免费的PD ...
python 操作pdf文档
简介在实际项目中,我们有可能需要提取当中的部分内容并导出,给PDF文件添加水印,合并多份PDF文件等等,而本文会着重用到PyPDF2模块来玩转PDF文档,以及tabula模块来对PDF文档中的表格数 ...
使用Java POI来选择提取Word文档中的表格信息
通过使用Java POI来提取Word(1992)文档中的表格信息,其中POI支持不同的ms文档类型,在具体操作中需要注意.本文主要是通过POI来提取微软2003文档中的表格信息,具体code如下(事 ...
Java 在PDF文档中绘制图形
本篇文档将介绍通过Java编程在PDF文档中绘制图形的方法.包括绘制矩形.椭圆形.不规则多边形.线条.弧线.曲线.扇形等等.针对方法中提供的思路,也可以自行变换图形设计思路,如菱形.梯形或者组合图形等 ...
python实用小技能分享，教你如何使用 Python 将 pdf 文档进行加密解密
上次说了怎么将word转换为pdf格式及实现批量将word转换为pdf格式(点击这里),这次我又get到一个新技能–使用 Python 将 pdf 文档进行加密解密,哈哈哈希望帮到更多人! ...
如何突出显示PDF文档中的一些重要文本信息
PDF文档中如果存在着太多的文字时,阅读者会容易遗漏很多重要的信息.但如果,文档中存在着一些特殊标记的文字时,比如标黄.标红文本时,很多人都会给予特别关注. 因此,当大家在使用pdfFactory专业 ...
C# 在PDF文档中应用多种不同字体
在PDF文档中,可绘制不同字体样式.不同语言的文字,可通过使用Standard字体.TrueType字体.CJK字体或者自定义(私有)等字体类型.下面通过C#程序代码来展示如何实现使用以上类型的字体来 ...

随机推荐

30行JavaScript代码实现一个比特币量化策略
精简极致的均线策略 30行打造一个正向收益系统原帖地址:https://www.fmz.com/bbs-topic-new/262 没错!你听的没错是30行代码!仅仅30行小编我习惯先通篇来看看代 ...
JavaScript 入门案例
四. JavaScript 入门案例在看本节之前,笔者建议您先看 JavaScript 基础篇 https://www.cnblogs.com/IT-LFP/p/10945884.html 1. ...
Spring + MyBaits 日志初始化两遍的问题
偶然发现一个问题,记录一下以备查询. 问题:系统启动时发现日志初始化了两次 14:28:04.798 [main] DEBUG org.apache.ibatis.logging.LogFactory ...
logstsh | logstash-input-jdbc 启动错误收集
1: Failed to execute action {:action=>LogStash::PipelineAction::Create/pipeline_id:main, :excepti ...
linux下创建用户及组
linux下创建用户及组: 1.创建组 groupadd 组名 2.创建用户,并将用户添加到组 useradd 用户名 -g 组名 3.更改用户的密码 password 用户名 4.修改目录 ...
New Year Tree CodeForces -620E
这个题有一个技巧:把颜色压到一个long long 上. #include<cstdio> #include<algorithm> #include<cstring> ...
Thinkpad x230设置启动顺序
设置可以从CD或者USB启动1.F1进入BIOS,Security → Secure Boot ,设置为:Disabled2.Startup → UEFI/Legacy Boot ,设置为:Both( ...
unix shell 解析 1
---- shell 1 testdb3:/home/oracle [pprod] >more /home/oracle/utility/macro/tns_log_back_12c.sh #! ...
Radis
http://www.redis.cn/ http://try.redis.io/ http://www.redisdoc.com/en/latest/ Redis 命令参考¶ 本文档是 Redis ...
Oracle用户角色权限相关视图
常用相关视图概述 DBA_SYS_PRIVS: 查询某个用户所拥有的系统权限 USER_SYS_PRIVS: 当前用户所拥有的系统权限 SESSION_PRIVS: 当前用户所拥有的全部权限 ROLE ...

第一节：python提取PDF文档中的图片

第一节：python提取PDF文档中的图片的更多相关文章

随机推荐

热门专题