斯坦福博士生谈可解释性:模型未说出口的推理
2026年8月28日,斯坦福大学计算机博士生Aryaman Arora接受采访,围绕AI可解释性研究展开对话。他师从Chris Potts和Dan Jurafsky,在访谈中谈及Anthropic的J-space论文、思维链与内部推理的差异、SAE与因果抽象两种研究路线,并讨论了可解释性在信任、监管和科学发现中的价值,以及模型人格、幻觉等话题。
Aryaman认为,可解释性研究试图回答“语言模型为何突然变得强大”这一问题。他介绍了Anthropic的J-space研究,该研究利用雅可比矩阵追踪模型内部激活方向,证明模型存在未说出口的推理步骤。他还对比了思维链与内部推理:思维链是模型写出的推理过程,而内部推理是模型未明确表达的隐藏计算。
在研究方法上,Aryaman区分了两种路线:一是以稀疏自编码器(SAE)为代表,通过训练模型将内部表征转换为清晰数字或自然语言;二是以因果抽象为代表,先提出假设再通过干预验证。他认为,可解释性对建立信任和监管AI至关重要,同时也有助于科学发现,例如从模型中提取可理解的算法。
关于模型人格和幻觉,Aryaman表示,可解释性研究已发现模型内部存在与性格相关的表征,但直接编辑模型想法目前尚不稳健。他认为,模型出错往往缺乏系统性解释,而可解释性未来有望帮助理解模型行为,为AI安全提供支持。
- 2026-08-28 10:25 | 36氪:AI可解释性与对齐:J-Space,思维链,AI人格,幻觉,与金门大桥阅读原文
如今的AI仍然是一个黑箱,我们知道如何训练模型,如何让它变得越来越聪明,也知道它最终给出了什么答案。但在输入和输出之间究竟发生了什么,我们仍然知之甚少。 试图打开这个黑箱、理解模型内部究竟发生了什么,正是可解释性研究(AI interpretability)希望解决的问题。过去几年,这个领域确实出现了不少令人兴奋的进展。 Anthropic的研究开始尝试追踪Claude模型内部的信息流,了解模型在回答问题前经历了怎样的内部计算。另有研究发现,模型内部似乎存在与特定概念、行为甚至“人格”相关的表征。Transluce则发现,模型会根据它认为自己正在与谁对话而改变行为。面对普通用户和AI安...