2026-09-19 05:20
AI123

北大与易鑫AI Lab联合研究:大模型答错或源于输出层“读出瓶颈”

北京大学与易鑫(YIXIN)AI Lab合作的研究论文《Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores》被自然语言处理顶级会议EMNLP 2026主会接收,录取率为15.4%。

该研究提出大模型推理评测中的“读出瓶颈”诊断视角,关注一个常被忽略的问题:模型在逻辑评测中答错,究竟是因为内部没有推导出正确答案,还是已经编码了正确答案,却在输出阶段被系统性偏差掩盖。

研究团队发现,在提示词结束或答案标记之后的节点上,线性探针能够以较高准确率从模型隐藏状态中解码出正确答案,但信息流经词表投影并聚合成完整候选序列分数时,准确率大幅下降。以Qwen3.5-9B在lexical-OOD测试切片上的表现为例,探针准确率达到0.830,而原生序列打分准确率跌至0.333,接近三分类随机盲猜。在1,000道测试题中,该模型原生序列打分有999道被判为同一个标签,表明输出层存在较强的全局偏好。

论文还提出一种极简修正方法:在无标签上下文分数上通过网格搜索拟合两个参数,使预测分布贴合类别先验。在Synthetic逻辑任务上,Qwen3.5-4B与9B的准确率从33.3%分别提升至57.0%和60.2%;在ProofWriter自然语言演绎任务上,准确率从33.3%提升至65.3%和67.8%。研究同时通过TF-IDF难例切片和保持标签总数的随机置换检验等对照,排除了浅层捷径与随机波动的替代解释。

该研究为审视大模型Benchmark评测方式提供了新的视角,提示社区在模型给出接近盲猜的分数时,不应轻易判定其缺乏推理能力,而应先检查隐藏状态中是否已经存在正确答案。

来源
  1. 2026-09-18 15:18 | cj.sina.com.cn:北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?
    阅读原文

    当大语言模型在逻辑题上给出错误答案时,我们通常会下一个很快的结论:它不会做这道题。但这个结论真的可靠吗?想象一下:学生已经在草稿纸上写出了正确推导,交卷时却把答案栏涂错了。只看答题卡,我们会说他 “不会”;如果能同时检查草稿,就会发现问题出在最后一步的表达。北京大学研究团队 和 易鑫(YIXIN)AI Lab 围绕大模型推理评测与内部表征展开合作,共同追问一个看似简单、却可能影响我们解读 Benchmark 结果的问题:当模型答错一道逻辑题时,它是真的没有想出来,还是已经想到了,却没有把正确答案表达出来?这项研究提出了一个专用于大模型的诊断视角:模型很可能已经在隐藏状态(Hidden Stat...

其他新闻

查看全部