生成 ocr key 字符集 alphabet 6698个字符

这段代码主要实现了两个功能:一是从指定的数据集和PPOCR中文key文件中生成OCR字符集alphabet,并保存为pkl文件;二是读取这个pkl文件,将字符集转换为对应的ASCII码列表。整个过程涉及到文本处理和序列化操作。
摘要由CSDN通过智能技术生成

 

生成 ocr key 字符集 alphabet

import pickle as pkl

#----------- 生成 ocr key 字符集 alphabet
alphabet_set = set()
# 数据集label
infofiles_label = ['/home/jlb/下载/rec_data_lesson_demo/train.txt', '/home/jlb/下载/rec_data_lesson_demo/val.txt']

# ppocr中文key
infofiles = ['/home/jlb/Project/OCR/ocr/recognize/ppocr_keys_v1.txt']

for infofile in infofiles:
    f = open(infofile)
    content = f.readlines()
    f.close()
    for line in content:
        line = line.replace("\n", "")
        alphabet_set.add(line)


for infofile in infofiles_label:
    f = open(infofile)
    content = f.readlines()
    f.close()
    for line in content:
        if len(line.strip())>0:
            if len(line.strip().split('\t'))!=2:
                print(line)
            else:
                fname,label = line.strip().split('\t')
                for ch in label:
                    alphabet_set.add(ch)

alphabet_list = sorted(list(alphabet_set))
pkl.dump(alphabet_list, open('alphabet.pkl','wb'))

读取字符集 alphabet

#----------- 读取字符集 alphabet
alphabet_list = pkl.load(open('/home/jlb/Project/OCR/ocr/recognize/alphabet.pkl','rb'))
alphabet = [ord(ch) for ch in alphabet_list]
alphabet_v2 = alphabet
print("----------------------- alphabet_v2:", len(alphabet_list), alphabet_list)

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值