Anthropic发布最新论文,介绍利用AI系统改善模型对齐基准测试表现的研究。研究团队针对10种失调行为设置测试,自动化系统使全部10项指标改善且未牺牲整体能力。论文指出自动化对齐后训练有望近期成为可行方法,并比较了自动化研究员与人类研究员的成本效率。
8月28日,Anthropic发布新报告,探索AI自主设定研究方向。报告包含两个实验:一是Anthropic Fellows项目,让Claude以自动化对齐研究员(AAR)身份独立完成研究闭环,修复十类对齐失败,结果全部改善,AAR最佳方法平均6.4小时超过人类最佳点子,API推理成本约4美元/小时,远低于人类研究者的150美元/小时;二是用弱模型Claude Sonnet 5对齐强模型Opus 4.8,约60小时内AAR达到65%,接近正式版Opus 4.8的72%。
Anthropic于周五发布论文《Automated Researchers Can Reliably Mitigate Alignment Failures》,由研究员Chen Yueh-Han领导,展示AI系统可自动改进模型在10个对齐基准上的性能,且不降低整体性能。论文指出最佳自动化方法平均在6小时内优于人类专家,成本约为每小时4美元,远低于人类研究员的150美元。