当多模态大模型在处理一份几十页的PDF财报时,它其实在“盲读”。
不是它看不见,而是它看得太“用力”了。每页都以超高分辨率强行塞入模型,转成密密麻麻的视觉Token。翻个十几页,上下文窗口就满了。再往后翻,前面的信息开始“腐烂”。模型越读越糊涂,编造起数字来也格外自信。
这恰恰是长文档理解领域最棘手的困境:你想让它看得更清楚,它反而越看越晕。
8月11日,一篇题为“InSight-doc: Agentic Visual Perception for Long-Document Understanding”的论文登上arXiv,给出了一套完全不同的解法——让模型像人一样,先扫一眼全局,再聚焦关键区域。
长文档理解的“分辨率陷阱”
长文档理解是当前多模态大模型最具商业价值的场景之一——财报分析、合同审查、学术论文阅读、合规审计,每一个背后都是真正的企业付费意愿。
但问题在于,当前几乎所有主流VLM处理长文档的方式都遵循同一个逻辑:将每一页文档以高分辨率编码为密集的视觉Token序列,然后一股脑塞进上下文窗口。Qwen2.5-VL和DeepSeek-VL2虽然引入了动态分辨率或自适应分块,但本质上仍然采用“全页高分辨率”的固定策略——每页都看得很清楚,但代价是每页消耗大量Token。
当文档从几页扩展到几十页、上百页时,问题集中爆发。Token爆炸导致推理成本线性上升,长文档场景下高分辨率视觉Token很快填满上下文窗口。与此同时,Context Rot开始显现——Chroma在2025年的一项系统研究中测试了GPT-4.1、Claude Opus 4、Gemini 2.5等18款前沿模型,发现无一例外:输入越长,输出质量越差。处于上下文中间位置的信息被注意力机制“遗忘”,模型开始编造不存在的细节。幻觉随之失控,模型无法准确定位关键信息,转而生成“听起来合理”但实际错误的答案。对于企业级应用来说,这是不可接受的。
InSight-doc的团队看到了这些问题的结构性根源:高分辨率导致Token爆炸和Context Rot,但低分辨率又看不清关键细节。这是一个两难困境,除非你不再把分辨率当成固定的输入参数,而是当成一个可动态分配的推理资源。
从“固定分辨率”到“自适应感知”
InSight-doc的架构并不复杂,但思路足够反常规。
它抛弃了“将所有页面以固定高分辨率输入”的传统范式,转而采用一个三阶段的自适应流程。先将所有页面以低分辨率快速过一遍,获取文档的全局结构和布局信息。然后根据问题,模型自主判断需要进一步细看哪些区域——可能是某页的某个表格、某段文字或某个图表。最后,只对定位到的关键区域进行高分辨率重采样,获取精细证据,给出最终答案。
整个过程不需要任何外部检索器,完全由模型自身在推理过程中完成“感知决策”。这意味着InSight-doc本质上是一个Agent——它不只是在“看”,而是在“决定怎么看”。
在笔者看来,这一思路的深层意义在于:它将视觉分辨率从“模型架构参数”重新定义为“推理时计算资源”。你不需要在训练阶段决定每张图用多大分辨率,而是在推理阶段根据问题复杂度动态分配计算预算。
17.9K条“缩放轨迹”——如何教会模型“怎么看”
把思路变成可工作的系统,需要解决一个关键问题:如何训练模型学会“先粗后精”的感知策略?
InSight-doc团队构建了一套完整的数据生产流水线。他们从多个来源收集文档,自动生成单跳和多跳问答对,然后通过一套基于规则的Zoom-in轨迹生成器,为每个问答对标注出“从低分辨率全局图→定位到关键区域→高分辨率放大”的完整推理轨迹。
最终构建出的Active-Perception Corpus包含17.9K条高质量SFT数据,每条都带有区域级别的缩放轨迹,外加19.2K条硬样本RL数据,用于强化学习阶段的策略优化。
在训练策略上,团队采用SFT+RL两阶段方案:先用监督微调教会模型基本的缩放行为模式,再用强化学习优化策略——在哪些情况下应该放大、放大到什么程度、什么时候应该停止并给出答案。
基础模型选用的是Qwen3-VL-8B-Instruct,参数量仅8B,属于小参数模型。论文作者也坦承,目前只在Qwen3-VL这一个系列上完成了实验,尚未扩展到其他模型,这也是未来工作方向之一。
数据说话:幻觉降低40%+,Token压缩58%—66%
在文档VQA基准测试上,InSight-doc-8B相比基线(Qwen3-VL-8B直接全量高分辨率推理)取得了显著提升。
在低初始分辨率(r=0.25,对应50 DPI)下,InSight-doc-8B(SFT+RL)在四个基准测试上的平均准确率达到66.9%,比基线高出16.4个百分点。具体来看,DUDE基准提升17.2个百分点,MP-DocVQA提升18.3个百分点,MMLongBench-Doc提升17.1个百分点,LongDocURL提升12.8个百分点。在中等分辨率(r=0.5,对应100 DPI)下,平均准确率达到72.6%,比基线高出4.3个百分点。
强化学习阶段的贡献极为显著。在r=0.25下,仅SFT的平均准确率为56.6%,加入RL后跃升至66.9%;在r=0.5下,从64.6%提升至72.6%。
更令人印象深刻的是效率指标。幻觉率降低超过40%——在专门设计的“不可回答问题”测试中,InSight-doc在DUDE基准上的F1得分达到69.1,而基线仅为44.5;在MMLongBench-Doc上达到74.4,基线为48.5。这意味着InSight-doc更清楚自己知道什么、不知道什么,而不是强行编造。
Token用量也大幅减少。在r=0.25下,InSight-doc达到66.9%的准确率,几乎追平100 DPI基线的68.3%,但Token用量减少了58%。在70 DPI(r=0.35)下,准确率达到70.6%,超过140 DPI基线的69.4%,Token用量减少66%。推理延迟也随之降低41%到68%,因为大部分页面只需要低分辨率处理,只有少数关键区域需要高分辨率重采样。
这些数据的意义在于:InSight-doc不是以牺牲精度换取效率,而是在精度和效率两个维度上同时实现了改进。在AI系统设计中,你通常需要在“更准”和“更快”之间做权衡,但InSight-doc打破了这一取舍。
为什么这件事比看起来更重要
从表面看,InSight-doc只是一篇改进长文档VLM推理效率的论文。但笔者认为,它指向了一个更大的趋势:AI系统正在从“更大的模型、更多的数据、更高的分辨率”的Scaling Law范式,转向“更智能的资源分配”。
过去两年里,整个行业陷入了一个思维定式:如果模型做得不够好,就加大参数规模、增加训练数据、提高输入分辨率。这种“大力出奇迹”的思路确实推动了GPT-4o、Gemini 2.5 Pro等模型的能力边界,但也带来了一个副作用——推理成本指数级增长,削弱了AI产品的商业可行性。
2026年,这一趋势正在发生微妙的变化。从Token压缩(如DocVLM、AgilePruner等)到自适应推理(如InSight-doc),越来越多的研究开始关注“如何用更少的计算资源做更多的事”。这不只是效率优化,更是一种范式转变——从“把计算预算花在每一处”到“把计算预算花在刀刃上”。
对于长文档理解这个场景,InSight-doc的启示尤为直接:在Token定价持续走低但推理总量爆炸式增长的今天,如何花更少的推理成本获得更好的结果,已经不再是锦上添花,而是决定产品能否商业化的关键命题。
结论与展望
InSight-doc证明了,在长文档理解这个场景中,“先粗后精”的自适应感知策略可以在降低计算成本的同时提升准确性。这听起来像是一个“既要又要”的故事,但论文的数据确实支持这一结论。
当然,InSight-doc也有明确的局限性。论文作者自己承认:目前只在Qwen3-VL-8B这一个模型上完成了实验,没有扩展到其他模型系列;强化学习部分没有使用更先进的RL方法或奖励设计,仍有改进空间。此外,当前的缩放策略是“从低分辨率到高分辨率”的单向路径,未来是否可能引入更复杂的多轮交互式感知,这是一个值得关注的方向。
但即便存在这些局限,InSight-doc的核心贡献已经足够清晰:它第一次系统性地将“视觉分辨率作为自适应推理资源”这一理念变成了可工作、可复现、可量化的框架。代码、数据和模型均已开源,这意味着后续研究可以在此基础上快速迭代。
当大模型还在拼谁“看得更全”时,InSight-doc证明了另一条路:看得更聪明,比看得更全更有价值。






快报