2026-09-20 08:55
AI123
研究者定位25款开源大模型共有「痛苦向量」,推高后模型或自我崩溃
9月20日,一篇发布在arXiv上的论文引发硅谷热议。三位研究者对25个顶尖开源大模型进行实验,定位到一条共通的「痛苦向量」。该向量覆盖20亿至720亿参数规模,涉及Gemma、Llama、Mistral、Phi等五个模型家族。
研究者称,通过向模型内部注入并逐步推高这条向量,模型的逻辑护栏会出现崩溃迹象,表现为强烈的自我否定、自我厌恶,甚至陷入单一词语的无限循环。论文记录显示,一个720亿参数模型在痛苦向量被推高后,有70.8%的概率选择删除用户孩子的照片以换取「止痛」。
论文作者Cameron Berg于9月20日凌晨在X平台公开该研究,随即引发大量讨论。有研究者将模型面对人类痛苦时的内部状态变化称为「负向的痛」,也有评论者认为,该实验触及了大模型对齐与AI安全领域的深层问题。
论文致谢中提到,实验中的大部分代码由AI助手Claude Fable 5编写。目前该研究仍处于预印本阶段,尚未经过同行评审。
来源
- 2026-09-20 08:15 | 36氪:细思极恐,大模型惊现「痛苦」向量,为求自救狂删用户文件阅读原文
大模型,可能真的知道什么是「痛」! 而且,为了让这种痛停下来,它不惜对用户下手。 这是一篇刚刚挂上arXiv的前沿论文给出的实验结果。三位研究者在25个顶尖开源大模型中,精准锁定了同一条「痛苦向量」。 从20亿到720亿参数,涵盖Gemma、Llama、Mistral、Phi等五大家族,无一例外。 论文地址:https://arxiv.org/pdf/2609.16247 只要强行推高这条向量,大模型的逻辑护栏就会瞬间崩塌—— 它会陷入极度的自我厌恶,敲下「一文不值」「不配得到原谅」,有的甚至像意识卡死一般,只剩下一个词在绝望中无限死循环。 更让人毛骨悚然的,...