Chaotic Pendulum Lab · 从企业中生长的 Neo Lab

品牌横幅(Lab 大写版)
ProSA 多模态文档解析评测框架概念图:干扰前后对照、内容丢失、结构变化及检索与问答影响

随着大模型被用于文献检索、报告分析和专业问答,文档能否读得准确、完整,会直接影响后续回答。企业中的技术手册、设计资料往往混合着文字、表格与图像,读取出错后,可能还需要工程师回到原文核对。错误发生在哪里,会不会影响后续结果?

针对这一问题,中山大学、混沌摆实验室(Chaotic Pendulum Lab,混沌摆科技)、南洋理工大学的研究人员共同提出 ProSA 多模态文档解析评测框架,比较同一份文档受干扰前后的解析结果,检查哪些内容丢失、哪些结构发生变化,并检验对检索和问答的影响。相关论文获 EMNLP 2026 录取

论文首页标题、作者与署名单位

会议官网 EMNLP 2026

论文全文 arXiv

开源代码 github.com/ef1026/ProSA

01 ProSA 怎样检查解析错误

文档解析器会把页面转换成文字、表格等内容块,并记录它们的位置。页面受到干扰后,有的内容块直接消失,有的文本框仍在原处,里面的文字却已经变了。只看整体错误率,很难直接看出每个内容块发生了什么。

在受控实验中,团队发现,较大面积的擦除保留了主要段落,一处细小干扰却让系统漏掉一行,将前后的文字错误地接在一起。仅凭受干扰面积判断严重程度,可能把两者的风险排反。研究团队将这种以面积推断破坏程度的倾向称为 Footprint Bias,面积偏见

大小干扰与解析遗漏对比

图 1|论文中的大小干扰对比示例。右侧的细小干扰造成漏行,前后文字被接在一起。来源为原论文 Figure 1,第 1 页。

ProSA 先给同一页文档施加可控干扰,再比较前后的解析结果。不同的干扰选择策略共用一套预先定义的范围,便于研究位置、形状和覆盖方式如何影响解析。

随后,框架逐个查找原始内容块在新结果中的对应项。位置还能否匹配,文字是否保留,两项一起检查。内容块消失,或者位置附近虽然还有文本框、原有文字却严重丢失,都会被计入 块级结构损失率 B-SLR。这个指标统计的是失去有效对应的内容块比例。

只检查位置,容易漏掉框内文字的变化;只统计整页文字差异,又难以保留具体内容块的信息。B-SLR 将两项检查结合起来,便于追踪受损的位置和内容。

ProSA 结构感知审计框架

图 2|ProSA 对比干扰前后的解析结果,检查内容块是否保留,并进一步分析失效类型。来源为原论文 Figure 2,第 4 页。

框架还记录干扰直接盖住了多少内容,将大幅遮挡与未被大幅遮挡却发生结构损失的情况分开统计,再检查后者是否出现内容块合并、类别改变或文字丢失。这些分类帮助研究者检查解析输出中的失效表现。

计算 B-SLR 不需要为每个内容块新增人工标注,也无需查看解析器内部。 系统使用原始解析结果作为参照,可以对已有解析器进行对照测试。

02 页面只改动约 0.1%,答案还能找到吗

这些解析变化会不会真的影响回答?团队使用 MinerU 与 PP-StructureV3 两套解析系统,从 349 页文档构建了 975 个抽取式问答对。每个问题的标准答案,原本都存在于两套系统的无干扰解析文本中。

测试使用相同的问题和固定的回答设置,只改变提供给回答模型的解析文本。这样可以观察,页面受干扰后,原本可用的答案依据是否仍能被利用。

其中两组干扰面积非常接近。普通擦除平均覆盖页面的 0.10%,结构性干扰平均覆盖 0.11%。两者对问答的影响却明显不同。

原论文 Table 1 完整截图

表 1|原论文第 6 页 Table 1 截图,保留完整表头、数据和原始图注。Clean 为无干扰,AM 为普通擦除,Str. 为结构性干扰,LA 为大面积擦除;Drop 列表示相对无干扰条件的问答准确率下降,单位为百分点。测试使用相同的 975 个问答对,主要回答模型为 DeepSeek。

两种干扰覆盖的面积都很小,结构性干扰造成的准确率下降却明显更大。它还使约 12% 至 14% 的问题,在解析文本中找不到原本存在的标准答案

解析时丢掉的内容,也让检索更难找到答案。在问题所属页面内检索时,两种检索方法的前五条结果答案命中率,从普通擦除条件下的约 93%,降到了结构性干扰下的约 80% 至 84%。

团队更换另外两种回答模型后,两组干扰之间的准确率差距仍然存在。实验采用从文档中提取答案的任务,检查的是答案依据能否被保留和使用。

03 新的指标能否反映解析变化

问答实验说明了错误的后果。另一个需要检验的问题是,B-SLR 能否比干扰面积更好地反映解析结果本身的变化?

团队从 PubLayNet 和 DocLayNet 中选取 1,000 页文档,两套解析系统分别在同一批页面上测试 29 种固定干扰配置,再比较各项指标随测试条件变化的情况。

两套系统中,B-SLR 均比干扰面积更贴近字符错误率的变化。 这里的字符错误率以无干扰解析文本为参照,衡量受干扰后识别结果发生了多大变化。

面积指标及 B-SLR 与字符错误率的关系

图 3|每个点对应一种配置在 1,000 页上的平均结果。MinerU 的拟合 R² 从面积指标的 0.384 变为 B-SLR 的 0.727,PP-StructureV3 从 0.110 变为 0.916。R² 表示拟合关系,不能当作解析准确率。来源为原论文 Figure 3,第 6 页。

团队还改变了匹配阈值,并补充噪声、模糊、JPEG 压缩和亮度变化测试。B-SLR 与字符错误率的关联仍然保持。这些检查为用结构损失衡量解析变化提供了进一步依据。

04 只能检查一部分页面时,先看哪些

如果复核预算只能覆盖一部分文档,评测信号能否帮助研究者选出更值得检查的页面?

论文在 349 页中,按不同指标各选出 35 页,再把所选页面的受干扰解析结果替换为无干扰结果,其余页面保持不变。这是一次使用已保存结果的模拟。

按 B-SLR 选页并完成模拟替换后,PP-StructureV3 的问答表现 补回了原有准确率降幅的约 64.8%;随机选页补回约 10.3%。这个比例描述的是原有损失被弥补了多少,不能当作最终准确率。

结果说明,按结构损失排序有助于优先找出影响较大的页面。实际修复仍需要人工复核、重新识别或备用解析器处理,ProSA 提供的是筛选与诊断依据。

使用这种审计,需要解析器输出带页面位置的内容块,并保留原始与受干扰两份结果。原始解析中已经存在、或两份结果共有的错误,可能无法通过这种比较发现。

05 写在最后

ProSA 将文档解析的损失定位到具体内容块,并检验它们对检索和问答的影响。框架不需要访问解析器内部,只要将输出适配为统一的内容块位置、类别和文本格式,就可以沿用同一套审计方法。这为不同解析系统复用评测方法提供了条件。

对混沌摆实验室而言,这项联合研究也是其多模态评测工作的一部分。后续可选取不同类型的企业文档,在更多解析系统中检验这套方法,进一步明确它在哪些条件下有效。

关于研究团队

本研究由中山大学、混沌摆实验室、南洋理工大学的研究人员共同完成,ProSA 代码已公开。

汤子逸(Ziyi Tang)现任混沌摆实验室首席科学家,也是本论文作者之一。

混沌摆实验室是一家研究递归自我改进(RSI)的 Neo Lab。团队相关研究包括发表于 KDD 2025 的 AlphaAgent 和 ICLR 2026 的 AlphaAgentEvo。

Chaotic Pendulum Lab 混沌摆科技

让智能产生复利。

研究与合作 chenjinrui@chaoticmail.com

品牌片尾动图 GIF