高考考试网
当前位置: 首页 高考资讯

tsr怎么使用(复杂场景的表格结构识别新利器)

时间:2023-07-10 作者: 小编 阅读量: 9 栏目名: 高考资讯

如何抽取及理解表格的技术一直都是IDP中的重要组成部分。其中,表格结构识别旨在从表格的图像中还原表格的结构信息,包括每个单元格的坐标位置以及每个单元格所属的行列信息。此外,目前基于该范式的方法在处理单元格较为密集的大表格时,精度相对较低。因此,基于该范式研究员们提出了TSRFormer。研究员们首先在三个较大规模的公开数据集SciTSR、PubTabNet以及WTW上验证了TSRFormer的性能。

近年来,各大企业和组织机构都在经历数字化转型。将文档转换成计算机所能识别的样态,是数字化转型的关键步骤,如何识别出图片中表格具体的结构与内容,并直接提取其中的数据和信息是学术界和工业界共同瞩目的焦点。然而,目前的表格识别算法多用于识别横平竖直的表格,对于全无边界和实线的表格、行列之间存在大片空白区域的表格等日常生活中常见的表格还没有较好的解决方案,对于拍摄角度倾斜而表格边框弯曲等情况更是束手无策。今天我们将为大家介绍微软亚洲研究院在表格结构识别方向的最新进展,研究员们提出了一种新的表格结构识别算法 TSRFormer,能够较好地识别复杂场景中不同类型的表格。

如今,各行各业正在向数字化转型,海量的文档型数据也源源不断地生成。用人工处理这些蕴含着丰富信息的文档,存在如耗时长、成本高、易出错等缺陷,在实际应用中难以高效执行。因此,社会对于自动化文档处理技术的需求日益增加,智能文档处理(IDP)成为了近几年的热点。与此同时,市场上也涌现出了许多相关产品,例如微软就提供了全方位的 IDP 服务及解决方案(https://adoption.microsoft.com/intelligent-document-processing/)。如图1所示,智能文档处理通过光学字符识别(OCR)、文档图像分析、计算机视觉,以及自然语言处理等技术,将复杂的非结构化文档数据转变为能被计算机直接理解和使用的结构化数据,从而帮助企业或个人更加高效地获取文档中的有用信息。

图1:智能文档处理(IDP)的流程示意图

在各类文档中,表格作为一种高效的信息表达形式,通常被人们用来呈现结构化的数据,例如公司财报、发票、银行流水、实验数据、医院检验报告等等。如何抽取及理解表格的技术一直都是 IDP 中的重要组成部分。

表格抽取技术解决的主要问题是如何自动地将图像中的表格数字化,其包含两个子任务:表格检测表格结构识别。其中,表格结构识别旨在从表格的图像中还原表格的结构信息,包括每个单元格的坐标位置以及每个单元格所属的行列信息。如图2所示,在实际场景中,表格结构识别是一个极具挑战性的问题。其挑战的难度主要在于表格的结构与内容的复杂多样性,例如存在完全无边界和实线的表格、包含许多空白单元格或者跨行跨列单元格的表格、行列之间存在大片空白区域的表格、嵌套的表格、密集的大表格、单元格包含多行文字内容的表格等等。不仅如此,在相机拍摄的场景中,有些表格的边框可能因拍摄角度而倾斜或弯曲,这都大大增加了表格结构识别的难度。

图2:表格图像的多样性与复杂性

近年来,表格结构识别领域受到了学术界与工业界的广泛关注,其中涌现出了大量研究成果。但这些研究成果的视角大多仅限于简单的应用场景,例如 PDF 或扫描文档中横平竖直的表格或分割线均为实线的表格,而对于图2中这些在实际场景中经常出现的情况,尤其是倾斜、弯曲且没有实线的表格关注度较低。因此,现有的算法距离完全解决实际场景中的表格识别问题还存在很大差距。为了让表格识别技术适用于更广泛的应用场景,微软亚洲研究院的研究员们提出了一种新的表格结构识别算法 TSRFormer[1],该算法能够较好地识别复杂场景中不同类型的表格。

TSRFormer: 提供表格结构识别新思路

现有的表格结构识别算法大致分为三种范式:编码-解码范式、自底向上范式和拆分-合并范式。编码-解码范式下的模型在输入表格图像后可以直接预测表示表格结构的编码序列(如 HTML、LaTeX 等)。该范式即使在识别较为容易的横平竖直表格的任务中,仍然需要远超于其他范式的训练数据才能产出较好的效果。若要进一步支持倾斜或弯曲的表格,则还需额外收集大量的数据,因此研发成本较高。此外,目前基于该范式的方法在处理单元格较为密集的大表格时,精度相对较低。

自底向上范式一般需要依赖额外的模块预先检测文本或单元格作为基础单元,再预测这些基础单元是否属于同一行、列或单元格从而定位表格结构。所以该范式难以处理包含大量空白单元格或空行空列的表格。

不同于以上两种范式,微软亚洲研究院的研究员们发现基于拆分-合并范式的方法具有更强的可扩展性,在复杂场景中只需要较少的训练数据就能达到很高的精度,而且可以鲁棒地处理包含空白单元格以及空行空列的表格。因此,基于该范式研究员们提出了 TSRFormer。如图3所示,对于输入的表格图像,TSRFormer 先由拆分模块预测出所有行、列的表格分割线,求交点后,生成 N x M 个单元格,再由合并模块预测相邻单元格是否需要合并从而恢复出跨多行、多列的单元格。

图3:TSRFormer 的整体结构图

在以往基于拆分-合并范式的方法中,预测拆分模块的表格线一般通过图像分割模型结合从分割图中提取表格分割线的后处理模块完成(如[2][3]等),而基于规则设计的后处理模块难以处理低质量的分割图,这严重降低了模型针对诸如倾斜、弯曲的表格识别的精度以及泛化能力。不同于既有设计,TSRFormer 提出了一种不需要后处理模块的全新思路:通过直接回归的方式来预测分割线。具体来说,该方法采用每条分割线上的若干采样点来表示该分割线,并让模型直接回归每条分割线上采样点的坐标,从而得到分割线的位置信息。

为了让 TSRFormer 能够精确且高效地预测表格分割线,研究员们还提出了一套新的基于两阶段 DETR[4] 的分割线回归算法:SepRETR。如图4所示,在第一阶段中,SepRETR 先用参考点预测模块,为每一条表格分割线预测出一个参考点(reference point);在第二阶段,由这些参考点的视觉以及空间信息组成的特征向量集合作为查询特征(query)输入进一个解码器(Transformer decoder)来回归对应的完整分割线。

图4:基于 SepRETR 的表格分割线预测模型(此处以行分割线为例)

在此基础上,研究员们进一步提出了两个改进算法来提升模型性能:(1)提出了基于先验增强的匹配策略来解决原始 DETR[5] 训练收敛慢的问题;(2)仅采样少量像素的特征作为解码器交叉注意力(cross attention)模块的输入,该方案可以使模型事半功倍,利用较少的计算量即可达到高定位精度。

实验结果及可视化效果

目前,学术界的绝大部分公开数据集都只包含 PDF 或者扫描文档图像中完全横平竖直的表格(如 SciTSR[6]、PubTabNet[7] 等)。与实际应用场景相比,这类数据集较为简单,不能涵盖日常生活中的所有表格类型。近一年,复杂场景中的表格结构识别问题逐渐受到关注,例如去年新发布的 WTW 数据集[8]就开始考虑实际自然场景中的表格。在该数据集中,由于相机拍摄引起的干扰,一些表格会出现倾斜或弯曲,这大大增加了表格结构识别问题的难度。但 WTW 数据集只考虑了分割线均为实线的表格,而没有包含无实线的表格。为了能够更全面地测试模型在各类场景下的性能,研究员们收集了一个更加复杂的数据集,该数据集包含了各式各样复杂场景的样本,例如结构复杂、包含大量空单元格或长跨行跨列单元格的无实线表格,以及倾斜甚至弯曲的表格等等。

研究员们首先在三个较大规模的公开数据集 SciTSR、PubTabNet 以及 WTW 上验证了 TSRFormer 的性能。从表1、表2以及表3的结果可以看出,无论是在横平竖直的简单场景(SciTSR、PubTabNet)还是在分割线均为实线的自然场景(WTW)表格识别任务上,TSRFormer 均比现有的方法表现得更加优秀。

表1:TSRFormer 与现有方法在 SciTSR 上的性能对比

表2:TSRFormer 与现有方法在 PubTabNet 上的性能对比(其中 TEDS[7] 指标同时考虑表格结构识别和表格内容 OCR 识别的精度,而 TEDS-Struct[10] 仅评测表格结构识别,因此后者更适用于公平比较表格结构识别模型的精度)

表3:TSRFormer 与现有方法在 WTW 上的性能对比

为了进一步验证 TSRFormer 的有效性,研究员们在更具挑战性的内部数据集上开展了实验,并将 TSRFormer 与另外两个基于拆分-合并范式的代表算法——SPLERGE[2] 和 RobusTabNet[3],进行了对比。为了使对比更加公平,在实现这三个方法的时候仅有表格分割线预测的部分不同,其余部分模型结构均保持一致。从表4可以看出,由于 SPLERGE 假设表格是横平竖直的,其在同样是横平竖直场景的数据集 SciTSR 和 PubTabNet 上都能取得接近 SOTA 的结果,但在包含倾斜甚至弯曲的内部数据集上则大幅度落后于 TSRFormer,F1-score 相差了11.4%。图5的可视化效果展示了 SPLERGE 与 TSRFormer 在复杂场景中的明显差距。

表4:TSRFormer 与 SPLERGE 在多个数据集上的性能对比

图5:TSRFormer(红)与 SPLERGE(蓝)的可视化效果对比

在表5的消融实验中,研究员们将基于直接回归的 TSRFormer 与目前基于图像分割的最优方案 RobusTabNet 进行了对比。TSRFormer 与 RobusTabNet 均能处理倾斜或弯曲的表格。根据表5的实验结果,在更具挑战性的内部数据集中,相比 RobusTabNet,TSRFormer 的 F1-score 高出2.9%。关于消融实验的其他细节,可见论文[1]。

表5:TSRFormer 与 RobusTabNet 在内部数据集上的对比,以及各模块的消融实验

图6中的可视化结果展示了基于直接回归方法的优势。对于图6这种单元格密集、弯曲且含有大面积空白区域的困难样本,基于图像分割的结果并不鲁棒,这使得后续的后处理模块难以提取出正确的分割线。而与之相反,基于直接回归思想的 TSRFormer 并不需要任何后处理模块,对表格中的数据和内容识别得更为精确。

原始表格

RobusTabNet 的可视化结果

TSRFormer 的可视化结果

图6:TSRFormer 与 RobusTabNet 的可视化结果对比

最后,图7展示了 TSRFormer 在多个场景表格图像上的可视化结果,可以看到该方法对于大部分复杂场景表格的识别呈现高鲁棒性。

图7:TSRFormer 在各个数据集上的可视化结果。(a-b)来自 SciTSR,(c-d)来自 PubTabNet,(e-h)来自 WTW,以及(i-l)来自内部数据集

未来的挑战

虽然 TSRFormer 在识别大部分场景的表格图像中取得了可喜成果,但要完全解决所有场景的表格结构识别问题道阻且长。主要问题在于,目前的算法只考虑了视觉图像单一模态的信息,而对于内容极为复杂的表格,例如单元格包含多行文字内容或存在极长且无实线的跨行跨列单元格,不仅需要利用图像信息,还需要充分理解图中文字的语义后,才能正确地识别表格结构。此外,现有的方法仍然无法解析多层级的嵌套表格。微软亚洲研究院的研究员们将不断推进表格结构识别的性能,也欢迎同行共同交流、探索该领域更好的技术!

参考文献:

[1] Weihong Lin, Zheng Sun, Chixiang Ma, Mingze Li, Jiawei Wang, Lei Sun, Qiang Huo. TSRFormer: Table structure recognition with Transformers. In ACM Multimedia, 2022.

[2] Chris Tensmeyer, Vlad I. Morariu, Brian Price, Scott Cohen, Tony Martinez. Deep splitting and merging for table structure decomposition. In ICDAR, 2019.

[3] Chixiang Ma, Weihong Lin, Lei Sun, Qiang Huo. Robust table detection and structure recognition from heterogeneous document images. Pattern Recognition, 2023.

[4] Xizhou Zhu, Weijie Su, Lewei Lu, Bin Li, Xiaogang Wang, Jifeng Dai. Deformable DETR: Deformable Transformers for end-to-end object detection. In ICLR, 2021.

[5] Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, Sergey Zagoruyko. End-to-end object detection with Transformers. In ECCV, 2020.

[6] Zewen Chi, Heyan Huang, Heng-Da Xu, Houjin Yu, Wanxuan Yin, XianLing Mao. Complicated table structure recognition. arXiv:1908.04729, 2019.

[7] Xu Zhong, Elaheh ShafieiBavani, Antonio Jimeno Yepes. Image-based table recognition: Data, model, and evaluation. In ECCV, 2020.

[8] Rujiao Long, Wen Wang, Nan Xue, Feiyu Gao, Zhibo Yang, Yongpan Wang, Gui-Song Xia. Parsing table structures in the wild. In ICCV, 2021.

[9] Sachin Raja, Ajoy Mondal, CV Jawahar. Table structure recognition using top-down and bottom-up cues. In ECCV, 2020.

[10] Liang Qiao, Zaisheng Li, Zhanzhan Cheng, Peng Zhang, Shiliang Pu, Yi Niu, Wenqi Ren, Wenming Tan, Fei Wu. LGPMA: Complicated table structure recognition with local and global pyramid mask alignment. In ICDAR, 2021.

[11] Hao Liu, Xin Li, Bing Liu, Deqiang Jiang, Yinsong Liu, Bo Ren, Rongrong Ji. Show, read and reason: Table structure recognition with flexible context aggregator. In ACM Multimedia, 2021.

[12] Xinyi Zheng, Douglas Burdick, Lucian Popa, Xu Zhong, Nancy Xin Ru Wang. Global table extractor (gte): A framework for joint table identification and cell structure recognition using visual context. In WACV, 2021.

    推荐阅读
  • 暴汗服正确穿法(如何穿着暴汗服)

    暴汗服的外表与运动服非常相似,而这种衣服大多都是采用腈纶或聚酯纤维材质制作而成,衣服的内部涂有银色涂层。相传穿上暴汗服运动,10分钟的出汗量相当于平时一小时的出现量。目前很多人都通过穿暴汗服运动来产生大量的汗液,从而希望达到减肥消脂的作用。从科学的角度来看,运动时穿吸汗的速干服会比暴汗服更合适,因为暴汗服不利于人体运动过程中散热,若体内积存大量的热量,会对人体内部坏境造成一定破坏。

  • 海南研究生学校有哪些(海南有哪些学校招收研究生)

    以下内容大家不妨参考一二希望能帮到您!海南研究生学校有哪些海南研究生学校有海南大学、海南热带海洋学院、海南师范大学、海南医学院。考研之后,无论是选择是工作还是公务员考试,还是选择继续深造,考研之后平台会更加的提高,随意选择会更加的宽阔。考研之后的划分会比之前更加的细致,对于之前囵囤的了解,会更加确定自己的就业走向,不会像之前一样徘徊是否要进行本行业的道路。是自己未来的道路更加清楚、明朗。

  • 演员濮存昕个人简历(演员濮存昕纵横驰骋的人生)

    濮存昕因此感到了孤独,感到精神上的痛苦。第二年,二十六岁的濮存昕成为一名正式的共产党员。空政话剧团有三台出名的话剧《九一三事件》《周郎拜帅》《W.M.》,濮存昕都不同程度地参与其中。在《九一三事件》中,濮存昕扮演了一个只有三分钟戏的飞行员。他执导《周郎拜帅》,请濮存昕主演周瑜。五年默默无闻的苦工,终于换回了“丈夫处世兮立功名”的喷薄而出的吟唱。

  • 甬行码申领(鄂W来了这样申领)

    千呼万唤始出来武汉交警发布公告26日起,鄂W号牌正式启用:车牌只是代号,请勿执迷车牌号只是一个代码,并不存在好坏之分。考虑到部分车主的个人偏好,交管部门推行了“牌号号码自选”,尽可能满足大家个性化选择。)4、缴纳工本费,领取行驶证、登记证书;5、选择号牌领取方式。

  • 秋葵有红色的果子吗(秋葵被称为植物黄金)

    在一些研究上还发现,胡萝卜素对于抗肿瘤、抗癌症还有一定的作用,是保护皮肤黏膜以及保护视力的必要营养物质,尤其是在秋天,时间越长,天黑的越快,视力不好的人就要多吃一些富含胡萝卜素、维生素A的食物了,在这里就可以选择秋葵。

  • 用废旧材料做风筝的方法(怎么用废旧材料做风筝)

    用废旧材料做风筝的方法?用废旧材料做风筝的方法:根据你所需要制作的风筝大小,选择一个合适的塑料袋;,下面我们就来聊聊关于用废旧材料做风筝的方法?接下来我们就一起去了解一下吧!用废旧材料做风筝的方法用废旧材料做风筝的方法:根据你所需要制作的风筝大小,选择一个合适的塑料袋;两根竹签从中间竖直扎成风筝骨架;用透明胶和线将塑料袋包在骨架外,绑出形状;然后把风筝线绑在风筝上就完成了。

  • 描述你的房子的英语句子(史上最全的房子里外英文词汇表达)

    史上最全的房子里外英文词汇表达HouseApartment房子/公寓Roof屋顶Eaves[ivz]屋檐Chimney['tʃɪmni]烟冲Tile[taɪl]瓦片Porch[pɔrtʃ]门廊Door门Gate大门Wall墙壁Fl。

  • 雷诺重型suv车型(雷诺首款具有阿尔卑斯)

    雷诺9月15日宣布,将于9月20日在欧洲开始接受新款SUV“Austral”“EspritAlpine”的订单。EspritAlpine的第一款车型EspritAlpine具有运动型的内饰和外观,灵感来自雷诺集团高性能汽车品牌“Alpine”的设计特性。配备Alpine品牌20英寸钻石切割成黑色Daytona铝制车轮和缎面黑色车顶纵梁。座椅采用特殊的Alcantara表面处理,采用碳纤维斜纹织物。铝制踏板和门槛带有Alpine标志。方向盘的设计也被考虑在内。目的是同时实现驾驶乐趣和仪表能见度。

  • 在冀惠保生效期间把医保转到了别的省还可以获得理赔吗?

    4、完成理赔冀惠保对特定高额药品用药合理性审核通过后,如在理赔申请前已自行购买目录内特定药品,保险公司将向被保险人支付理赔款。

  • excel如何取消分页符(excel取消分页符的方法)

    接下来我们就一起去研究一下吧!excel如何取消分页符首先点击打开excel表格。打开软件后,进入到表格窗口。选中分页符交叉位置右下方的单元格,然后点击鼠标右键,在列表中选择删除单元格,便可同时删除水平和竖直分页符。若想单独删除竖直分页符,选中竖直分页符右侧一列的任意单元格。