温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

怎么使用Python提取Word中的图片

发布时间:2022-07-19 17:13:06 来源:亿速云 阅读:318 作者:iii 栏目:开发技术

这篇文章主要介绍“怎么使用Python提取Word中的图片”,在日常操作中,相信很多人在怎么使用Python提取Word中的图片问题上存在疑惑,小编查阅了各式资料,整理出简单好用的操作方法,希望对大家解答”怎么使用Python提取Word中的图片”的疑惑有所帮助!接下来,请跟着小编一起来学习吧!

    1.思路

    在网上查找了半天,基本都是提取word中文字的,没有找到可以把word中的图片提取出来的方法。一个巧合的情况下,发现将word的后缀名改为zip,然后解压该zip,可以看到原来word是这样存储的:

    怎么使用Python提取Word中的图片

    图片就存放在固定的文件夹下:/word/media/;

    怎么使用Python提取Word中的图片

    那么我们就只需要批量的修改文件后缀名,并且解压之后将图片拷贝到需要存放的地方,然后将该文件夹清空留作下次的路径,并且将文件从zip改回docx即可。(注意:doc不支持这个方法,如果需要提取doc格式的图片,可以先转为docx,再提取即可)

    2.具体实现

    2.1导入相关库

    '''
    ===========================================
      @author:  renjiaxin
      @time:    2018/8/9 0009   10:00
    ===========================================
    '''
     
    import zipfile
    import os
    import shutil

    2.2定义函数

    为了方便和其他函数调用,直接写了个函数完成这个功能,在这里,我们需要以下四个参数:

    • word文档的路径

    • zip压缩文件的路径

    • 临时解压的tmp路径

    • 最后需要保存的store_path路径

    def word2pic(path, zip_path, tmp_path, store_path):
        '''
        :param path:源文件
        :param zip_path:docx重命名为zip
        :param tmp_path:中转图片文件夹
        :param store_path:最后保存结果的文件夹(需要手动创建)
        :return:
        '''

    2.3重命名word文件,将后缀名docx改为zip

        # 将docx文件重命名为zip文件
        os.rename(path, zip_path)
        # 进行解压
        f = zipfile.ZipFile(zip_path, 'r')
        # 将图片提取并保存
        for file in f.namelist():
            f.extract(file, tmp_path)
        # 释放该zip文件
        f.close()

    2.4zip还原为docx文件,并获得图片的列表

        # 将docx文件从zip还原为docx
        os.rename(zip_path, path)
        # 得到缓存文件夹中图片列表
        pic = os.listdir(os.path.join(tmp_path, 'word/media'))

    2.5将图片复制到需要保存的文件夹中

    并且我们将文件的名字命名为word所在的路径

        # 将图片复制到最终的文件夹中
        for i in pic:
            # 根据word的路径生成图片的名称
            new_name = path.replace('\\', '_')
            new_name = new_name.replace(':', '') + '_' + i
            shutil.copy(os.path.join(tmp_path + '/word/media', i), os.path.join(store_path, new_name))

    2.6删除tmp缓冲文件夹中的文件,用以存储下一次的文件

        # 删除缓冲文件夹中的文件,用以存储下一次的文件
        for i in os.listdir(tmp_path):
            # 如果是文件夹则删除
            if os.path.isdir(os.path.join(tmp_path, i)):
                shutil.rmtree(os.path.join(tmp_path, i))

    2.7运行程序

    if __name__ == '__main__':
        # 源文件
        path = r'E:\dogcat\提取图片\log.docx'
        # docx重命名为zip
        zip_path = r'E:\dogcat\提取图片\log.zip'
        # 中转图片文件夹
        tmp_path = r'E:\dogcat\提取图片\tmp'
        # 最后保存结果的文件夹
        store_path = r'E:\dogcat\提取图片\测试'
        m = word2pic(path, zip_path, tmp_path, store_path)

    3效果预览

    3.1源word

    怎么使用Python提取Word中的图片

    3.2提取的图片

    怎么使用Python提取Word中的图片

    4附:doc转docx

    from win32com import client
    import traceback
     
    def doc2docx(doc_name, docx_name):
        '''
        # doc转docx
        :param doc_name: doc文档路径
        :param docx_name: docx文档路径
        :return:
        '''
        try:
            # 首先将doc转换成docx
            word = client.Dispatch("Word.Application")
            doc = word.Documents.Open(doc_name)
            # 使用参数16表示将doc转换成docx
            doc.SaveAs(docx_name, 16)
            doc.Close()
            word.Quit()
        except:
            traceback.print_exc()

    到此,关于“怎么使用Python提取Word中的图片”的学习就结束了,希望能够解决大家的疑惑。理论与实践的搭配能更好的帮助大家学习,快去试试吧!若想继续学习更多相关知识,请继续关注亿速云网站,小编会继续努力为大家带来更多实用的文章!

    向AI问一下细节

    免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

    AI