Paddle OCR数据集制作

PPOCRLabelv2是一个基于Python3和PyQT5的OCR标注工具,内置PP-OCR模型,支持矩形框、表格和不规则文本标注。用户可自定义模型,使用数据集划分脚本进行训练集、验证集和测试集的划分。该工具适用于OCR模型的训练和优化。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

PPOCRLabelv2是一款适用于OCR领域的半自动图形标注工具,内置PP-OCR模型,自动检测和重新识别数据。用Python3和PyQT5编写,支持矩形框、表格、不规则文本和关键信息标注方式。标注可以直接用于PP-OCR检测识别模型的训练。

  1. 标注方法:自动标注后,对没有标注上的手动绘制矩形框,重新识别,check,导出标签文件。

  1. 注意事项

①标注矩形框先标左上角再标注右下角

②自动识别在矩形框大小合适时识别正确率高

③进入paddle_env,PPOCRLabel启动标注

④重复标注矩形框,会增加识别训练中的图像

  1. 内置模型

  • 默认模型:PPOCRLabel默认使用PaddleOCR中的中英文超轻量级OCR模型,支持中英文和数字识别,多语言检测。

  • 模型语言切换:支持切换内置模型语言,点击菜单栏“PaddleOCR”-“选择OCR模型”即可。目前支持的语言包括法语、德语、韩语和日语。具体模型下载链接请参考PaddleOCR模型列表

add parameter det_model_dir in self.ocr = PaddleOCR(use_pdserving=False, use_angle_cls=True, det=True, cls=True, use_gpu=gpu, lang=lang)

  1. 数据集划分

在终端输入如下命令执行数据集划分脚本:

cd ./PPOCRLabel # Change the directory to the PPOCRLabel folder
python gen_ocr_train_val_test.py --trainValTestRatio 6:2:2 --datasetRootPath ../train_data 

参数说明:

  • trainValTestRatio是训练集、验证集、测试集图片个数的划分比例,根据自己的实际情况设置,默认为6:2:2

  • datasetRootPath是PPOCRLabel标注的完整数据集的存储路径。默认路径为PaddleOCR/train_data.

|-train_data
  |-crop_img
    |- word_001_crop_0.png
    |- word_002_crop_0.jpg
    |- word_003_crop_0.jpg
    | ...
  | Label.txt
  | rec_gt.txt
  |- word_001.png
  |- word_002.jpg
  |- word_003.jpg
  | ...

数据集拆分后

详情请参考

半自动标志工具PPOCRLabel https://github.com/PaddlePaddle/PaddleOCR/blob/release/2.6/PPOCRLabel/README.md

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值