合合信息亮相CCIG2023：多位大咖共话智能文档未来，文档图像内容安全还面临哪些技术难题？-程序员宅基地

近日，中国图象图形大会（CCIG 2023）（简称“大会”）在苏州圆满落幕。本届大会以“图象图形·向未来”为主题，由中国科学技术协会指导，中国图象图形学学会主办，苏州科技大学承办，特邀谭铁牛院士、赵沁平院士、吴一戎院士等百余位国内外知名学者，来自代表企业的技术专家，共话图像图形学术研究与技术创新趋势，共谋行业新发展。

技术论坛《文档图像智能分析与处理》是本次大会的亮点之一，由华南理工大学二级教授、中国图象图形学学会常务理事金连文担任主持，合合信息智能技术平台事业部副总经理、高级工程师丁凯博士出席该论坛，并与来自中科院自动化所、北大、中科大的学术专家，华为等知名企业的研究者们，围绕文档图像处理的前沿技术展开“头脑风暴”，寻找文档图像处理领域的未来进阶方向。

大模型技术提升文字识别效率，智能文档处理难题被突破

近期，ChatGPT的爆火让“大模型”技术进入了公众的视野。随着人工智能技术的飞速发展，作为图像图形技术的重要应用场景之一，文档图像智能处理逐步应用到医疗、教育等诸多领域，为各行各业提供更加高效、智能的文档管理和数据分析解决方案，大模型技术的崛起也为文档处理带来了新的机遇。

中国科学院自动化研究所副所长刘成林认为，大模型与光学字符识别（OCR）技术的结合，能够对海量数据进行理解、处理。具体到实践层面，大模型技术还有可观的提升空间。从识别性能来说，大模型技术在场景文本、逻辑版面、文档问答等方面还有很多工作可以做；此外，大模型的可解释性、安全度十分重要，还需要研究者们进行更为深入的探讨。

北京大学邹月娴教授认为，在与文档图像处理技术密切相关的OCR领域中，专业化大规模的预训练模型是可行的。“大模型是一个大的趋势，对于小团队来说做工具是一个非常好的方法，做工具对大家都是有好处的。”邹月娴说。

华为AI研究员廖明辉提到，企业作为文档图像处理的应用方，普遍面临一个挑战：当有众多API时，维护难度较高，急需一个垂直领域的通用的OCR大模型，能够覆盖所有的使用场景。廖明辉认为，OCR垂直领域的大模型在数据量方面，数据的数量不是最关键的，最关键的是数据的多样性。

除了引入大模型等新技术外，如何实现文档图像的智能分析与处理还面临着诸多来自现实的挑战。丁凯博士认为，文档的多样性和复杂性是文档图像处理中的难点：文档类型和格式繁多，包括报告、合同、发票、证明、证件等。不同类型的文档有不同的格式和布局，例如文档中常常包含图片、表格、图形等各种图像，难以用统一的方法处理。

丁凯提到，文档图像中的弯曲、阴影、摩尔纹，字迹不清晰等问题对文档图像的识别与处理产生了影响，刘成林也表示，“过去我们只关注文字，现在文档中的图像也十分重要。但是，现有文档图像识别技术在识别精度和可靠性、可解释性、自适应性等方面还有明显不足，还有很多技术问题有待解决。”

值得关注的是，人工智能大模型的快速发展为文档分析与识别带来了一些机遇，除了解决识别层次的遗留问题，在性能提升、应用拓展上大有可为。合合信息通过ROI提取、干扰去除、形变矫正、图像恢复以及图像增强这一整体架构对文档进行智能扫描与识别分析，将文档图像的弯曲矫正、摩尔纹去除，图像质量大幅提升。

除文档图像的通用场景外，合合信息对特定垂直场景下的图像也能进行预处理，针对手写板图片中出现的反光问题，通过算法模型对反光进行“擦除”。

由于版面复杂多变、文本内容多样化等原因，文档被拍照、扫描成电子文档过程中时常出现漏字、错位，合合信息持续突破版面分析技术在版面分割、区域间的逻辑关系处理等方面的难题，通过智能文字识别、智能图像处理等核心技术，确定文档中的文字位置、字体、大小和排版方式等信息，实现版面的分析和还原。

文档篡改检测技术为视觉内容安全提供保障

目前，人工智能的合成技术导致伪造的多媒体信息在网络上泛滥成灾，文本图像显然是重灾区之一。针对资质证书、文案、聊天截图等文本图像的伪造被用于散播谣言、经济诈骗、编造虚假新闻，给个人、社会造成恶劣的负面影响。图像内容安全是AI安全的重点领域，如可对文本篡改痕迹进行精准检测，将为图像内容安全提供保障。

中科大教授谢洪涛指出，随着基于深度学习的伪造与取证技术的出现，目前文本图像的真伪鉴定问题进入了攻防博弈阶段。“文本图像的篡改生成视觉质量高、字体风格统一、背景纹理协调、篡改字迹清晰，文本图像的篡改检测可以说是‘道高一尺、魔高一丈’，适应多种篡改方法、多域空间感知、区域文理区分、时间复杂度适中。”谢洪涛表示。

谢洪涛所在的课题组正在探索基于文本笔迹的文本图像生成，以及基于频域关系的局部纹理差异性建模，最终实现高质量的场景文本图像篡改生成、准确的场景文本图像篡改检测。相关研究可应用于文本图像的多个领域，例如文档图像、自然场景图像、票据图像等。

合合信息在文档图像内容安全领域也进行了深入的部署。据丁凯介绍，合合信息研发了基于深度学习的图像篡改检测技术及相关系统，通过学习图像被篡改后统计特征的变化，该系统智能捕捉图像在篡改过程中留下的细微痕迹，可检测出复制粘贴、拼接、擦除等多种篡改形式，让人工智能准确识别出图片篡改的不同类型，并进行针对性的处理，提升识别精度和场景通用性。据悉，合合信息图像篡改检测技术已被银行、保险、制造业等多个行业引入。

作为一家人工智能企业，合合信息依托智能文档处理技术，对复杂场景下的多版式、多语种文字内容进行精准提取，打造的合同机器人、财报机器人及行业解决方案，已在金融、政务、制造、物流等30个行业落地，服务的世界500强公司超过80家。未来，合合信息将持续为全球C端用户和多元行业B端客户提供数字化、智能化的产品及服务，促进AI技术在文档处理领域的应用落地与信息安全保障。

本文链接：https://blog.csdn.net/INTSIG/article/details/130726403

原作者删帖不实内容删帖广告或垃圾文章投诉

智能推荐

linux devkmem 源码,linux dev/mem dev/kmem实现访问物理/虚拟内存-程序员宅基地

文章浏览阅读451次。dev/mem: 物理内存的全镜像。可以用来访问物理内存。/dev/kmem: kernel看到的虚拟内存的全镜像。可以用来访问kernel的内容。调试嵌入式Linux内核时，可能需要查看某个内核变量的值。/dev/kmem正好提供了访问内核虚拟内存的途径。现在的内核大都默认禁用了/dev/kmem，打开的方法是在 make menuconfig中选中 device drivers --> ..._dev/mem 源码实现

vxe-table 小众但功能齐全的vue表格组件-程序员宅基地

文章浏览阅读7.1k次，点赞2次，收藏19次。vxe-table，一个小众但功能齐全并支持excel操作的vue表格组件_vxe-table

（开发）bable - es6转码-程序员宅基地

文章浏览阅读62次。参考：http://www.ruanyifeng.com/blog/2016/01/babel.htmlBabelBabel是一个广泛使用的转码器，可以将ES6代码转为ES5代码，从而在现有环境执行// 转码前input.map(item => item + 1);// 转码后input.map(function (item) { return item..._让开发环境支持bable

FPGA 视频处理 FIFO 的典型应用_fpga 频分复用视频-程序员宅基地

文章浏览阅读2.8k次，点赞6次，收藏29次。摘要：FPGA视频处理FIFO的典型应用，视频输入FIFO的作用，视频输出FIFO的作用，视频数据跨时钟域FIFO，视频缩放FIFO的作用_fpga 频分复用视频

R语言：设置工作路径为当前文件存储路径_r语言设置工作目录到目标文件夹-程序员宅基地

文章浏览阅读575次。【代码】R语言：设置工作路径为当前文件存储路径。_r语言设置工作目录到目标文件夹

background 线性渐变-程序员宅基地

文章浏览阅读452次。格式：background: linear-gradient(direction, color-stop1, color-stop2, ...);<linear-gradient> = linear-gradient([ [ <angle> | to <side-or-corner>] ,]? &l..._background线性渐变

随便推点

【蓝桥杯省赛真题39】python输出最大的数中小学青少年组蓝桥杯比赛算法思维python编程省赛真题解析-程序员宅基地

文章浏览阅读1k次，点赞26次，收藏8次。第十三届蓝桥杯青少年组python编程省赛真题一、题目要求（注：input（）输入函数的括号中不允许添加任何信息）1、编程实现给定一个正整数N，输出正整数N中各数位最大的那个数字。例如:N=132，则输出3。2、输入输出输入描述：只有一行，输入一个正整数N输出描述：只有一行，输出正整数N中各数位最大的那个数字输入样例：

网络协议的三要素-程序员宅基地

文章浏览阅读2.2k次。一个网络协议主要由以下三个要素组成：1.语法数据与控制信息的结构或格式，包括数据的组织方式、编码方式、信号电平的表示方式等。2.语义即需要发出何种控制信息，完成何种动作，以及做出何种应答，以实现数据交换的协调和差错处理。3.时序即事件实现顺序的详细说明，以实现速率匹配和排序。不完整理解：语法表示长什么样，语义表示能干什么，时序表示排序。转载于:https://blog.51cto.com/98..._网络协议三要素csdn

The Log: What every software engineer should know about real-time data's unifying abstraction-程序员宅基地

文章浏览阅读153次。主要的思想，将所有的系统都可以看作两部分，真正的数据log系统和各种各样的query engine所有的一致性由log系统来保证，其他各种query engine不需要考虑一致性，安全性，只需要不停的从log系统来同步数据，如果数据丢失或crash可以从log系统replay来恢复可以看出kafka系统在linkedin中的重要地位，不光是d..._the log: what every software engineer should know about real-time data's uni