Python实现提取表格(1)

 现实中常常会遇到从图片或pdf中提取表格,下面我们解释如何使用python实现。

#从图片中提取表格
from img2table.document import Image
# Instantiation of the image
img = Image(src="1.jpg")
from img2table.ocr import TesseractOCR
# Instantiation of the OCR, Tesseract, which requires prior installation
languages = "eng+chi_sim"
ocr = TesseractOCR(lang=languages)
# Table identification
img_tables = img.extract_tables(ocr=ocr,borderless_tables=True)
# Result of table identification
img_tables
#从PDF中提取表格
from img2table.document import PDF
from img2table.ocr import TesseractOCR
# Instantiation of the pdf
pdf = PDF(src="11.pdf")
# Instantiation of the OCR, Tesseract, which requires prior installation
ocr = TesseractOCR(n_threads=3,lang="chi_sim")
# Table identification and extraction
pdf_tables = pdf.extract_tables(ocr=ocr,borderless_tables=True,min_confidence=99)
# We can also create an excel file with the tables
pdf.to_xlsx(dest='tables.xlsx',ocr=ocr,borderless_tables=True,min_confidence=99)

使用paddleocr精确度更高,需要安装pip install img2table[paddle]

#调用PaddleOCR---准确度更高
from img2table.ocr import PaddleOCR
ocr = PaddleOCR(lang="ch")
img = Image(src="3.png")
# Table identification
img_tables = img.extract_tables(ocr=ocr,borderless_tables=True)
# Result of table identification
img_tables

高级玩法---训练自己的识别字库:可参考下面的链接中的文章,非常详细,尝试可以。

jTessBoxEditor工具安装和使用操作-CSDN博客

  • 8
    点赞
  • 15
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值