北大与易鑫AI Lab联合研究:大模型答错或源于输出层“读出瓶颈”
北京大学与易鑫(YIXIN)AI Lab合作的研究论文《Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores》被自然语言处理顶级会议EMNLP 2026主会接收(录取率15.4%)。该研究提出大模型推理评测中的“读出瓶颈”诊断视角,发现模型可能在隐藏状态中已编码正确答案,但被输出层系统性偏差掩盖,并设计了分阶段诊断方法验证。