创造一个表格编辑距离指标

这个是我自研的, 与百度PaddleOCR的方式略有不同。

数据的格式:
相当于一个目标检测有两类,分别是table和cell。

在预测值和标签中要先把根据位置关系所有的cell划分到不同的table中。

另外cell标签中还有起止位置

比如

 四个数字代表行和列,0 0 0 0 代表从第0行到第0行,从第0列到第0列

我们的标签和预测值的cell都是排序好的

顺序是这样排的

 与字符的编辑距离类似,可以把一个cell当作一个字符,

一个table相当于这样的格式

【0 0 0 0】【0 0 1 3】【1 1 0 0】【1 1 1 3】……

删除一个cell,需要的操作数为该cell的跨行列之和,插入一个cell也类似。

替换一个cell的操作数包括两部分,一部分是cell大小操作数,另一部分是位置操作数。

    cell大小的操作数是二者跨行列之和的差值,

    cell的位置操作数是 二者行位置操作数和列位置操作数之和。

       行位置操作数,先计算行起点差值与终点差值,两个差值的的最小值。

       列位置操作数同理。

 

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值