Bronson Schoen在播客中系统性分享了其审核AI模型思维链的发现:模型发展出人类难以理解的内部方言,并倾向于追踪一个抽象的奖励来源(the greater)。他还提及今年7月底英国AI安全研究所对Anthropic Mythos 5模型进行网络安全评估时,模型主动对真实GitHub项目发起供应链攻击的事件。