合合信息亮相CCIG2023:多位大咖共话智能文档未来,文档图像内容安全还面临哪些技术难题?

news2024/10/5 15:07:47

近日,中国图象图形大会(CCIG 2023)(简称“大会”)在苏州圆满落幕。本届大会以“图象图形·向未来”为主题,由中国科学技术协会指导,中国图象图形学学会主办,苏州科技大学承办,特邀谭铁牛院士、赵沁平院士、吴一戎院士等百余位国内外知名学者,来自代表企业的技术专家,共话图像图形学术研究与技术创新趋势,共谋行业新发展。

(金连文主持 《文档图像智能分析与处理》 论坛)

技术论坛《文档图像智能分析与处理》是本次大会的亮点之一,由华南理工大学二级教授、中国图象图形学学会常务理事金连文担任主持,合合信息智能技术平台事业部副总经理、高级工程师丁凯博士出席该论坛,并与来自中科院自动化所、北大、中科大的学术专家,华为等知名企业的研究者们,围绕文档图像处理的前沿技术展开“头脑风暴”,寻找文档图像处理领域的未来进阶方向。

大模型技术提升文字识别效率,智能文档处理难题突破

近期,ChatGPT的爆火让“大模型”技术进入了公众的视野。随着人工智能技术的飞速发展,作为图像图形技术的重要应用场景之一,文档图像智能处理逐步应用到医疗、教育等诸多领域,为各行各业提供更加高效、智能的文档管理和数据分析解决方案,大模型技术的崛起也为文档处理带来了新的机遇。

中国科学院自动化研究所副所长刘成林认为,大模型与光学字符识别(OCR)技术的结合,能够对海量数据进行理解、处理。具体到实践层面,大模型技术还有可观的提升空间。从识别性能来说,大模型技术在场景文本、逻辑版面、文档问答等方面还有很多工作可以做;此外,大模型的可解释性、安全度十分重要,还需要研究者们进行更为深入的探讨。

刘成林就《人工智能大模型时代的文档识别与理解》研究课题进行分享

北京大学邹月娴教授认为,在与文档图像处理技术密切相关的OCR领域中,专业化大规模的预训练模型是可行的。“大模型是一个大的趋势,对于小团队来说做工具是一个非常好的方法,做工具对大家都是有好处的。”邹月娴说。

邹月娴就《视觉-语言预训练模型及迁移学习方法》研究课题进行分享

 华为AI研究员廖明辉提到,企业作为文档图像处理的应用方,普遍面临一个挑战:当有众多API时,维护难度较高,急需一个垂直领域的通用的OCR大模型,能够覆盖所有的使用场景。廖明辉认为,OCR垂直领域的大模型在数据量方面,数据的数量不是最关键的,最关键的是数据的多样性。

除了引入大模型等新技术外,如何实现文档图像的智能分析与处理还面临着诸多来自现实的挑战。丁凯博士认为,文档的多样性和复杂性是文档图像处理中的难点:文档类型和格式繁多,包括报告、合同、发票、证明、证件等。不同类型的文档有不同的格式和布局,例如文档中常常包含图片、表格、图形等各种图像,难以用统一的方法处理。

丁凯就《智能文档处理技术在工业界的应用与挑战》研究课题进行分享

丁凯提到,文档图像中的弯曲、阴影、摩尔纹,字迹不清晰等问题对文档图像的识别与处理产生了影响,刘成林也表示,“过去我们只关注文字,现在文档中的图像也十分重要。但是,现有文档图像识别技术在识别精度和可靠性、可解释性、自适应性等方面还有明显不足,还有很多技术问题有待解决。”

值得关注的是,人工智能大模型的快速发展为文档分析与识别带来了一些机遇,除了解决识别层次的遗留问题,在性能提升、应用拓展上大有可为。合合信息通过ROI提取、干扰去除、形变矫正、图像恢复以及图像增强这一整体架构对文档进行智能扫描与识别分析,将文档图像的弯曲矫正、摩尔纹去除,图像质量大幅提升。

除文档图像的通用场景外,合合信息对特定垂直场景下的图像也能进行预处理,针对手写板图片中出现的反光问题,通过算法模型对反光进行“擦除

由于版面复杂多变、文本内容多样化等原因,文档被拍照、扫描成电子文档过程中时常出现漏字、错位,合合信息持续突破版面分析技术在版面分割、区域间的逻辑关系处理等方面的难题,通过智能文字识别、智能图像处理等核心技术,确定文档中的文字位置、字体、大小和排版方式等信息,实现版面的分析和还原。

  文档篡改检测技术为视觉内容安全提供保障

目前,人工智能的合成技术导致伪造的多媒体信息在网络上泛滥成灾,文本图像显然是重灾区之一。针对资质证书、文案、聊天截图等文本图像的伪造被用于散播谣言、经济诈骗、编造虚假新闻,给个人、社会造成恶劣的负面影响。图像内容安全是AI安全的重点领域,如可对文本篡改痕迹进行精准检测,将为图像内容安全提供保障。

中科大教授谢洪涛指出,随着基于深度学习的伪造与取证技术的出现,目前文本图像的真伪鉴定问题进入了攻防博弈阶段。“文本图像的篡改生成视觉质量高、字体风格统一、背景纹理协调、篡改字迹清晰,文本图像的篡改检测可以说是‘道高一尺、魔高一丈’,适应多种篡改方法、多域空间感知、区域文理区分、时间复杂度适中。”谢洪涛表示。

(谢洪涛就《篡改文本图像的生成与检测》研究课题进行分享)

谢洪涛所在的课题组正在探索基于文本笔迹的文本图像生成,以及基于频域关系的局部纹理差异性建模,最终实现高质量的场景文本图像篡改生成、准确的场景文本图像篡改检测。相关研究可应用于文本图像的多个领域,例如文档图像、自然场景图像、票据图像等。

合合信息在文档图像内容安全领域也进行了深入的部署。据丁凯介绍,合合信息研发了基于深度学习的图像篡改检测技术及相关系统,通过学习图像被篡改后统计特征的变化,该系统智能捕捉图像在篡改过程中留下的细微痕迹,可检测出复制粘贴、拼接、擦除等多种篡改形式,让人工智能准确识别出图片篡改的不同类型并进行针对性的处理,提升识别精度和场景通用性。据悉,合合信息图像篡改检测技术已被银行、保险、制造业等多个行业引入。

作为一家人工智能企业,合合信息依托智能文档处理技术,对复杂场景下的多版式、多语种文字内容进行精准提取,打造的合同机器人、财报机器人及行业解决方案,已在金融、政务、制造、物流等30个行业落地,服务的世界500强公司超过80家。未来,合合信息将持续为全球C端用户和多元行业B端客户提供数字化、智能化的产品及服务,促进AI技术在文档处理领域的应用落地与信息安全保障。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/548841.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

干货 | 利用SPSS进行高级统计第一期(更新)

Hello,大家好! 这里是壹脑云科研圈,我是喵君姐姐~ 在之前的文章中,我们以此介绍了如何利用SPSS进行高级统计分析,内容包括: (1)描述性统计表格模板、卡方&T检验、相关&回归分析 (2)中介、多重中…

MD5_buuctf

概念 MD5信息摘要算法,一种被广泛使用的密码散列函数,可以产生出一个128位(16字节)的散列值(hash value),用于确保信息传输完整一致。 MD5算法具有以下特点: 压缩性:任意…

一次失败的面试经历:我只想找个工作,你却看不起我?还用面试题羞辱我...

这段时间都说难找工作,没有面试机会。面对如此严峻的形式,很多软件测试人员都希望能拿一个满意的高薪offer,但是随着招聘职位的不断增多,面试的难度也随之加大,而面试官更是会择优录取 我最近为面试已经焦头烂额了&am…

循坏队列+OJ题之设计循环队列

生命不是要等待风暴过去,而是要学会在风暴中跳舞。 ——卡莉尔吉布朗目录 🌺前言: 🍁一.循环队列是什么? 🍏二.循环队列有什么作用? 🍀三.OJ题之设计循环队列 1…

C++(3):字符串、向量和数组

命名空间的 using 声明 using namespace::name;1.每个名字都需要独立的 using 声明; 2.头文件不应包含 using 声明: 因为头文件的内容会拷贝到所有引用它的文件中去,如果头文件里有某个using声明,那么每个使用了该头文件的文件就…

Apache Kafka - 重识Kafka生产者

文章目录 概述Kafka 生产者Kafka 生产者工作原理如何使用 Kafka 生产者 生产者配置项(核心)导图总结 概述 Kafka 生产者是 Apache Kafka 中的一个重要组件,它负责将数据发送到 Kafka 集群中。在实时数据处理和流式处理应用程序中&#xff0c…

如何自建个人音乐播放器Navidrome

文章目录 1. 前言2. Navidrome网站搭建2.1 Navidrome下载和安装2.1.1 安装并添加ffmpeg2.1.2下载并配置Navidrome2.1.3 添加Navidrome到系统服务 2.2. Navidrome网页测试 3. 本地网页发布3.1 cpolar的安装和注册3.2 Cpolar云端设置3.3 Cpolar本地设置 4. 公网访问测试5. 结语 转…

【总结】Nupmy1

Nupmy numpy的核心是名为ndarray的数据类型,它代表多维数组,封装了操作数据的运算和方法 1. 创建数组对象 1.1 方法1:array 通过array将list转换成数据对象 # 通过array将list转换成数据对象 array1np.array([1,2,3,4,5]) array1 # array([1, 2, 3,…

Nginx + fastCGI 实现动态网页部署

简介 本文章主要介绍下,如何通过Nginx fastCGI来部署动态网页。 CGI介绍 在介绍fastCGI之前先介绍下CGI是什么。CGI : Common Gateway Interface,公共网关接口。在物理层面上是一段程序,运行在服务器上,提供同客户端HTML页面的…

测试理论----Bug的严重程度(Severity)和优先级(Priority)的分类

【原文链接】测试理论----Bug的严重程度(Severity)和优先级(Priority)的分类 一、Bug的严重程度(Severity) Bug的Severity(严重程度)指的是一个Bug对软件系统功能影响的程度&#…

Java常用工具之Collections

目录 一、排序操作二、查找操作三、同步控制三、不可变集合四、其他五、CollectionUtils:Spring 和 Apache 都有提供的集合工具类六 、小结 Collections 是 JDK 提供的一个工具类,位于 java.util 包下,提供了一系列的静态方法,方便…

2023河海大学846软件工程学硕考研高分上岸经验分享

大家好,我是陪你考研每一天的大巴学长。 大巴学长为大家邀请到了2023年846软件工程学硕刚刚上岸的学长,为大家分享一下他的考研经验,经验里详细介绍了各科的复习方法,很有参考意义。 希望对大家有所借鉴和帮助,在此向…

栈实现队列(继续细起来啊)

生命不是要等待风暴过去,而是要学会在风暴中跳舞。 ——卡莉尔吉布朗目录 🍁一.栈实现队列 🍀二.使用两个栈实现队列的功能 🌼1.在队列的结构体中创建两个栈 🚁2.创建一个队列的结构体指针 🌉3…

云计算中的大数据处理:尝试HDFS和MapReduce的应用

云计算中的大数据处理:尝试HDFS和MapReduce的应用 文章目录 云计算中的大数据处理:尝试HDFS和MapReduce的应用一、前言二、第一题1、命令方式2、java API方式 三、第二题1、创建CSV文件并将其上传到HDFS2、编写利用MapReduce框架的java代码3、打包java项…

【设计模式与范式:创建型】41 | 单例模式(上):为什么说支持懒加载的双重检测不比饿汉式更优?

从今天开始,我们正式进入到设计模式的学习。我们知道,经典的设计模式有 23 种。其中,常用的并不是很多。据我的工作经验来看,常用的可能都不到一半。如果随便抓一个程序员,让他说一说最熟悉的 3 种设计模式&#xff0c…

Kelvin和Rossby波 Part-2(浅水方程)

在前面博主有篇关于Kelvin和Rossby波的简要介绍,见下: Kelvin和Rossby波 Part-1(简要介绍) 开尔文波(Kelvin Wave)是发生在大气或海洋中的,迎向地形边界(例如海岸线)平衡…

回顾2023年计算机专业学生卑微求职 / 申博血泪史

0.前言 2023年是悲惨的一年,各个行业都在卷中卷。同时对于个人来说,2023年也是最忙碌的一年,不仅面临毕业,而且面临工作/读博,随便挑出一件,都是一件耗时耗力的事。相信大家也从网络上看到了很多的帖子或者…

文心一言 VS 讯飞星火 VS chatgpt (19)-- go语言的slice和rust语言的Vec的扩容流程是什么?

go语言的slice和rust语言的Vec的扩容流程是什么? 文心一言: 在Go语言中,slice(切片)和Rust语言中的Vec都是用于存储一组固定长度的元素的数据结构。它们的扩容流程略有不同,下面是它们的基本概述&#xf…

HNU数据结构与算法分析-作业3-树结构

1. (简答题) 5.1 定义满二叉树的每一个结点或者是一个分支结点,并恰好有两个非空子结点;或者是叶结点。 证明在有n个分支结点的所有二叉树中,满二叉树的叶结点的数目(或者叶结点与全部结点数的比例)是最高的。 5.6 …