文档智能处理的任务流程:一些建构与思考

本文虽然介绍了文档智能处理,但是主要是「按照文档材料的再数字化流程来重塑文档智能处理的任务流程」,侧重于「格式各异的文档加工整理成图文分离、格式与内容分离的编辑稿的过程」。现在为了实现文档的智能处理,将文档处理拆分成了预处理、解析、识别、还原和再生这几个过程,旨在提供高质量的数字化文档。但是在不久的将来,这些「技术也许会被端到端的GPT-4V这样的多模态通用大模型所取代」---因此「相关技术途径是否有继续研究的必要,是需要慎思的」---希望读者理性对待。

背景介绍

基本内涵

理解和定位

文档智能本身主要是为了处理各种各样的格式,然后还原成相应的格式。

主要过程

处理流程

预处理阶段

解析阶段

识别阶段

还原阶段

再生阶段

应用阶段

部分关键技术

场景文字检测与识别

版面分析技术

其他文档内容识别

通用文档理解预训练模型

应用场景

文档信息抽取

文档智能问答

结语

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值