给AI换个“大动力小心脏”之OCR异构加速

最新推荐文章于 2023-04-28 17:38:58 发布

VIP文章腾讯技术工程

最新推荐文章于 2023-04-28 17:38:58 发布

阅读量863

点赞数 1

文章标签： OCR 异构加速 ai 异构腾讯

本文链接：https://blog.csdn.net/Tencent_TEG/article/details/78806353

版权

导语：OCR在通用文字识别等场景下有广泛应用，基于FPGA异构加速的OCR识别相比CPU/GPU实现具有延时小、成本低的优势。我们设计了多FPGA芯片协同的异构加速架构，能快速适配业务OCR模型变化，检测识别整体性能为GPU P4 130%，处理延时仅为P4的1/10，CPU的1/30。

文字识别技术- OCR

OCR技术，通俗来讲就是从图像中检测并识别字符的一种方法，在证通用文字识别、书籍电子化、自动信息采集、证照类识别等应用场景中得到了广泛应用。通用场景的OCR因此通用场景下的OCR技术一直都是人工智能领域挑战性极强的研究领域，不需要针对特殊场景进行定制，可以识别任意场景图片中的文字。

通用OCR技术包含两大关键技术：文本检测和文字识别。检测模型的作用简单来说就是确定图片中哪里有字，并把有字的区域框出来。文字识别是将文本检测box作为输入，识别出其中的字符。

近年来深度学习逐渐被应用到音频、视频以及自然语言理解等时序数据建模的领域。通过深度学习的端到端学习提升Sequence Learning的效果已经成为当前研究的热点。基本思路是CNN与RNN结合：CNN被用于提取有表征能力的图像特征，将RNN的序列化特性引入到文本检测，增加了文本检测候选区域的上下文信息，可以有效地提升文本检测任务的性能。CNN+RNN的混合网络将文本串识别领域的效果推到了一个新的高度。

图1：CRNN网络结构

*上图引用自《An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition》。

我们以目前应用十分广泛的CRNN模型为例，它是DCNN和RNN的组合，可以直接从序列标签学习，不需要详细的标注；比标准DCNN模型包含的参数要少很多。同时CRNN在图像特征和识别内容序列之间严格保序，擅长识别字分割比较困难的文字序列。

架构包括三部分：

最低0.47元/天解锁文章

腾讯技术工程

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
给AI换个“大动力小心脏”之OCR异构加速

导语：OCR在通用文字识别等场景下有广泛应用，基于FPGA异构加速的OCR识别相比CPU/GPU实现具有延时小、成本低的优势。我们设计了多FPGA芯片协同的异构加速架构，能快速适配业务OCR模型变化，检测识别整体性能为GPU P4 130%，处理延时仅为P4的1/10，CPU的1/30。文字识别技术- OCROCR技术，通俗来讲就是从图像中检测并识别字符的一种方法，在证
复制链接

扫一扫