办公利器!用Python批量识别发票并录入到Excel表格_python识别发票

本文介绍了如何安装必要的库(如cnocr和ImageMagick/Tesseract-OCR),并详细步骤解析如何通过Python提取发票中的中文内容(如金额、名称、纳税人识别号和开票人)。还涵盖了批量识别发票并保存至Excel以及发票真伪验证的方法,提供了一套Python学习资源给零基础读者。
摘要由CSDN通过智能技术生成

安装的命令如下:
在这里插入图片描述
发票中含有中文内容,我们需要对图片中的中文进行识别,那么 cnocr 是一个不错的选择。

提示:安装好上面的库之外,还需要安装额外的exe文件,不然会出现下面这种错误
在这里插入图片描述
需要安装的exe文件:

  1. ImageMagick
  2. tesseract-OCR

这两个软件的安装过程就不再赘述了,大家可以自行搜索教程进行安装。

03.提取内容

下面以其中一张图片为例,讲解如何提取目标内容:金额、名称、纳税人识别号、开票人。
在这里插入图片描述
读取图片:pic/pic1.jpg
在这里插入图片描述

1.提取金额

需要截取到发票中金额的位置
在这里插入图片描述
这里的left、top、right、bottom的数值是通过多次修改定位而来。大家根据自己的发票内容去定位即可。
在这里插入图片描述
接着将图片中的数字提取出来
在这里插入图片描述
同样的,下面继续提取:名称

2.提取名称

在这里插入图片描述
在这里插入图片描述
这里的名称是中文的,咱们不能再像提取金额(数字)操作。需要使用到cnocr去将图片中的中文取出
在这里插入图片描述
在这里插入图片描述

3.提取纳税人识别号

在这里插入图片描述
在这里插入图片描述
将图片中的纳税人识别号提取出来,结果如下:
在这里插入图片描述

4.提取开票人

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
由于有中文,咱们这里同样和提取名称一样,使用cnocr将图片中的中文取出。
在这里插入图片描述
ok这样我们就将发票中的四个目标内容提取出来,接着将文件夹pic下的所有发票,进行识别将内容保存到excel。

04.批量识别发票并保存到excel

在读取图片之前,先将上面的四个操作封装成函数,方便每一种发票对象进行调用。
在这里插入图片描述
读取文件夹下的所有图片。
在这里插入图片描述
在这里插入图片描述
开始进行识别,并将结果写入到excel中。
在这里插入图片描述
最后保存为:发票汇总-李运辰.xls,其结果如下:
在这里插入图片描述

05.发票验证真伪

在我的交流群里,和小伙伴聊到这个内容时,小伙伴建议可以加一个功能:发票验证真伪。
在这里插入图片描述
所有在上面的开始识别之前(自己公司的发票可能不需要查验这步),先调用一下第三方的接口,对发票进行识别,识别通过之后再将其提取发票中目标内容。

1.申请百度AI应用

在这里插入图片描述

2.获取token

在这里插入图片描述
这里的client_id 为官网获取的AK, client_secret 为官网获取的SK,是上面申请好应用即可获取

3.查验

在这里插入图片描述

咱以这张图片为例,进行查验
在这里插入图片描述
其中的发票类型对应如下:
在这里插入图片描述
结果如下:
在这里插入图片描述
感觉这个结果查询不是很好(不详细)。下面还可以去税务局查询

4.税务局查询发票

在这里插入图片描述
同样以这张图片为例,进行查验
在这里插入图片描述
填写好信息点击查验,结果如下:
在这里插入图片描述
再税务局查验更加清晰。读者可以根据自己的情况去选择自己的方式去查验。

06.小结

本文基本就成功实现目标要求,从效果来看还是非常不错的!感兴趣的读者可以自己尝试!

一定要动手尝试!一定要动手尝试!一定要动手尝试!

读者福利:知道你对Python感兴趣,便准备了这套python学习资料

👉[[CSDN大礼包:《python兼职资源&全套学习资料》免费分享]]安全链接,放心点击

对于0基础小白入门:

如果你是零基础小白,想快速入门Python是可以考虑的。
一方面是学习时间相对较短,学习内容更全面更集中。
二方面是可以找到适合自己的学习方案

包括:Python激活码+安装包、Python web开发,Python爬虫,Python数据分析,人工智能、机器学习等习教程。带你从零基础系统性的学好Python!

零基础Python学习资源介绍

  • ① Python所有方向的学习路线图,清楚各个方向要学什么东西
  • ② 600多节Python课程视频,涵盖必备基础、爬虫和数据分析
  • ③ 100多个Python实战案例,含50个超大型项目详解,学习不再是只会理论

一、Python所有方向的学习路线

Python所有方向路线就是把Python常用的技术点做整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。

二、学习软件

工欲善其事必先利其器。学习Python常用的开发软件都在这里了,给大家节省了很多时间。

三、入门学习视频

我们在看视频学习的时候,不能光动眼动脑不动手,比较科学的学习方法是在理解之后运用它们,这时候练手项目就很适合了。

网上学习资料一大堆,但如果学到的知识不成体系,遇到问题时只是浅尝辄止,不再深入研究,那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友,可以戳这里无偿获取

一个人可以走的很快,但一群人才能走的更远!不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人,都欢迎加入我们的的圈子(技术交流、学习资源、职场吐槽、大厂内推、面试辅导),让我们一起学习成长!

  • 33
    点赞
  • 39
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值