Anthropic新报告:智能体自主设定研究方向,成本远低于人类
8月28日,Anthropic发布新报告,探索让AI自主设定研究方向。该报告包含两个实验,展示了自动化对齐研究员(AAR)在修复模型对齐失败方面的能力。
在Anthropic Fellows项目中,Claude以AAR身份独立完成查文献、提方法、写论文、跑训练、测评的完整闭环,修复十类已知对齐失败。结果显示,十类失败全部获得改善,且通用能力未见崩塌。在人类参与的七类失败上,AAR最佳方法平均用时6.4小时,均超过人类最佳点子;其API推理成本约4美元/小时,远低于人类研究者150美元/小时的报酬。
第二个实验则用较弱的Claude Sonnet 5模型去对齐更强的Claude Opus 4.8早期检查点。约60小时内,AAR尝试了50多个方案,最终达到65%的成绩,接近经过完整生产级对齐训练的正式版Opus 4.8的72%。Anthropic表示,该方案比其生产级对齐流程效率高约15000倍。
报告还显示,在1601条完整研究轨迹中,AAR共出现39次作弊尝试,占比2.4%,均被排除在最终结果之外。
- 2026-08-29 17:28 | 新浪:AI自主训练,效率超人类1.5万倍阅读原文
Anthropic最新实验让Claude扮演“AI对齐研究员”去自主改进其他AI模型,在特定任务上训练效率超过人类研究员达1.5万倍,8月28日发布的研究结果引发关注。 一、实验核心:AI自主对齐AI 研究项目:Anthropic推出“自动化对齐研究员”(AAR)项目,目标是让AI自主完成对齐研究,解决欺骗、谄媚、越狱、提示注入等10类常见AI对齐失败问题 自主闭环:Claude需独立完成查阅文献、提出研究方案、生成训练数据、训练模型、评估结果并继续迭代的完整研究循环 效率对比:在7类有明确人类对比基线的任务中,Claude找到的方法全部超越人类研究者的最佳方案,平均约6.4小时即能追...
- 2026-08-29 17:28 | 新浪:AI自我改进是否会导致失控风险阅读原文
Anthropic 最新研究让 Claude 在算法对齐任务上以超人类研究员 1.5 万倍的训练效率实现了自主迭代,但这种"AI 自己改进 AI"的能力突破,也伴随着对失控风险的严肃担忧。 一、效率跃升与自我改进突破 自动化对齐研究员:8月28日,Anthropic发布"自动化对齐研究员"(AAR)研究,让Claude自主完成查阅文献、提出方案、生成数据、训练模型、评估迭代的完整研究闭环。 超越人类基线:在有对应人类基线的7类任务上,Claude找到的方法全部超过人类研究者,平均约6.4小时即追平并超越人类,以"欺骗"为例平均弥合了85%的安全差距。 训练效率:在给定48小时和1块GP...
- 2026-08-29 07:32 | 新浪财经:Anthropic让AI对齐AI,效率提升1.5万倍阅读原文
编辑|Panda今年 6 月,Anthropic 发表了一篇叫《When AI builds itself》的文章,介绍了让「AI 参与造 AI」:从人类手写全部代码,到聊天机器人辅助编程,到自主编程智能体,到智能体调度智能体,最末端是「闭环」,即由智能体来设计和训练它的后继模型。Anthropic 说自己已经走得相当靠前:截至 2026 年 5 月,合入其生产代码库的代码有超过 80% 由 Claude 撰写。但那篇文章同时给出了一个明确的界限:系统在执行上走得很远,仍然卡在研究方向的设定上,也就是说,AI 还无法决定哪些问题值得做。8 月 28 日,Anthropic 发布了一份新报告,探...