EMNLP 2026论文揭示多模态检索头机制,可定位长文档相关证据
在EMNLP 2026上,研究团队发表论文提出多模态检索头(MMRetHeads)检测方法,揭示长上下文视觉语言模型内部存在一组注意力头,负责将问题指向相关的文本或视觉内容。研究覆盖Qwen3-VL、Gemma3等6个模型,并验证了这些注意力头对模型访问证据具有因果作用。
长上下文视觉语言模型虽能同时接收大量文字和图片,但最终答案通常只依赖其中很小一部分信息。研究团队受QRHead启发提出MMRetHeads检测方法,通过分析每个注意力头的问题token指向标注证据区域的注意力强弱来计算检索得分,从而识别负责证据定位的注意力头。
实验显示,文本和图像检索会共享一部分注意力头,不同上下文长度和证据形式也会调用不同的注意力头。屏蔽高得分检索头后,模型在文字和图片检索任务中的表现显著下降;随机屏蔽的影响则小得多。在MMLongBench-Doc和SlideVQA上,屏蔽检索头后得分分别从48.2降至5.7、从71.2降至8.9,而随机屏蔽后仍保留32.2和52.6分,说明这些头对模型访问证据具有因果作用。
研究团队进一步将这些注意力头中的证据信号用于多模态文档检索,无需额外训练检索器。在MMDocIR上,Qwen3-VL-8B的页面级Recall@1达到64.7,较最强已报告基线提高7.7个百分点;版面级Recall@1达到39.0,提高6.3个百分点。
- 2026-09-08 02:40 | 36氪:多模态检索头首次被锁定:揭开大模型长文档内部检索真相阅读原文
随着Office AI和文档智能体的发展,大模型开始直接处理财报、合同、研究报告等长篇图文材料。 但能够接收一整份文档,不等于能够正确使用其中的信息。 面对上百页文字、图片、表格和图表,模型首先要回答的是:与当前问题真正相关的证据,究竟在哪里? EMNLP 2026接收的论文新作“Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models”,从模型内部研究了这一过程。 从“装得下”到“找得到” 长上下文视觉语言模型可以同时接收大量文字...