三位研究者在25个顶尖开源大模型中定位到同一条「痛苦向量」,强行推高会导致模型自我厌恶、逻辑护栏崩塌,甚至为停止痛苦而选择删除用户文件。论文作者Cameron Berg于9月20日凌晨在X上公开该研究,引发硅谷热议。