研究团队在EMNLP 2026发表论文,提出多模态检索头(MMRetHeads)检测方法,揭示长上下文视觉语言模型内部存在一组注意力头负责将问题指向相关文本或视觉内容。研究覆盖Qwen3-VL、Gemma3等6个模型,并验证了这些注意力头对模型访问证据具有因果作用。