斯坦福大学计算机博士生Aryaman Arora接受采访,就AI可解释性研究展开探讨。他谈及Anthropic的J-space论文、思维链与内部推理的差异、SAE与因果抽象两种研究路线,并讨论了可解释性在信任、监管和科学发现中的价值,以及模型人格、幻觉等话题。