前DeepMind研究员披露:大模型加密推理可被重放,两个Token可改变Kimi-K3回答风格
前Google DeepMind研究员Ilia Shumailov和Alexander Panfilov做客Machine Learning Street Talk播客,讨论其论文《Stealing Reasoning Traces from Proprietary LLM APIs》。他们发现Anthropic、OpenAI、Google等前沿实验室的加密推理可被重放到同家族小模型中,并解码出31.5万条隐藏推理,泄露API密钥等隐私。他们还发现预填充两个来自Opus的Token会使Kimi-K3的答案风格变得像Opus,但无法解释原因。