返回新闻列表
2026-09-08 21:25
AI123

前DeepMind研究员披露:大模型加密推理可被重放,两个Token可改变Kimi-K3回答风格

2026年9月,前Google DeepMind研究员Ilia Shumailov与ELLIS Institute Tübingen博士生Alexander Panfilov做客Machine Learning Street Talk播客,围绕论文《Stealing Reasoning Traces from Proprietary LLM APIs》展开讨论。该研究揭示,Anthropic、OpenAI、Google等前沿实验室的大模型在加密推理环节存在架构级漏洞:加密的思考数据块可被重放到同家族更小的模型中,从而被解码。

研究团队从GitHub和Hugging Face公开的Agent轨迹中解码出约31.5万条隐藏推理,其中一些包含API密钥、邮箱、内部IP地址等隐私信息。Alexander在访谈中表示,最令他震惊的是攻击的简易性——第三次尝试就拿到了一个通用越狱方法,成功解码了Anthropic模型的推理过程。访谈中还涉及被投毒的Agent轨迹、思维链监控、负责任披露及防御措施等话题。

另一个无法解释的现象是,仅在Kimi-K3推理开头预填充两个来自Opus的Token,其部分可见答案就会呈现Opus式的风格。GLM、DeepSeek、Inkling均未出现相同现象,两位研究者坦言无法解释Kimi-K3为何会将开头Token与最终答案关联。他们强调,这只是公开互联网上迄今最相关的证据,并非因果证明。

在防御层面,研究者提出最简单的方案是不要将推理过程返回给用户;如果必须发送,可考虑链式加密,防止推理块在随机上下文中被重放。他们同时指出,这类观察性研究无法证明某个模型被蒸馏,但凸显了加密推理在隐私与安全方面面临的挑战。

来源
  1. 2026-09-08 20:35 | 36氪:两个Token就让Kimi“变成”Claude?前Google DeepMind研究员意外撞上中国大模型的蒸馏疑云
    阅读原文

    前沿 AI 模型在回答前会先“思考”,再把加密后的思考过程像密封信封一样交还给用户。前 Google DeepMind 研究员 Ilia Shumailov 和 ELLIS Institute Tübingen、MPI-IS 博士生 Alexander Panfilov 却发现,这个封条几乎没什么用。这些数据块可以跨用户、跨会话,甚至在同系列模型之间重放。把强模型的加密推理塞给同一家族的小模型,就能套出 GPT-5、Claude 等前沿模型原本藏起来的思考。 他们随后从 GitHub 和 Hugging Face 公开的 Agent 轨迹中,解码出了 31.5 万条隐藏推理。其中一些包含在...

其他新闻

查看全部