返回新闻列表
2026-08-29 22:15
AI123

Anthropic发布论文:自动化AI研究员可有效缓解对齐失效

Anthropic于8月28日发布最新论文《自动化研究员能够可靠缓解对齐失效》,介绍利用AI系统改善模型在系列对齐基准测试中表现的研究。

研究团队针对10种具体失调行为设置测试,自动化系统使全部10项指标均有改善,且未牺牲模型整体能力。该系统由Anthropic研究员计划成员领导开发,工作流程类似传统科研:先查阅已有文献,提出训练方法,再按方案训练模型30分钟,通过多轮尝试逐步提高测试成绩,有效方案保留、无效方案淘汰,使研究过程能够快速扩大规模。

论文指出,这些结果初步证明自动化对齐后训练有望在近期成为真正可行的方法。论文还对比了自动化对齐研究员(AAR)与人类研究人员的表现和成本:最优秀的AAR方法平均只需6小时即可超过经验丰富的人类研究员提出的方案;AAR每小时API推理成本约4美元,而人类研究人员每小时费用为150美元。

不过该方法仍有明显限制,包括基准测试能否准确反映真正的对齐目标,以及自动化研究员依赖的研究文献需要持续维护和扩充。

来源
  1. 2026-08-29 21:55 | 新浪:Anthropic揭示“AI训练AI”新法,比人类研究员成本更低速度更快
    阅读原文

    (来源:IT之家)  IT之家 8 月 29 日消息,用 AI 模型训练其他 AI 模型,正成为新一代 AI 实验室重点探索的方向。当地时间 28 日,Anthropic 研究员计划的一名研究人员展示了这种思路真正落地后可能呈现的样子。  Anthropic 发布了最新论文《自动化研究员能够可靠缓解对齐失效》,介绍如何利用 AI 系统改善模型在一系列对齐基准测试中的表现。研究团队针对 10 种具体的失调行为设置测试,自动化系统最终让全部 10 项指标都有所改善,同时没有牺牲模型的整体能力。  这套系统由 Anthropic 研究员计划成员陈岳翰(音译)领导开发,工作流程与传统科研相似。自动化系...

  2. 2026-08-29 21:25 | IT之家:Anthropic 揭示“AI 训练 AI”新方法,比人类研究员成本更低、速度更快
    阅读原文

    IT之家 8 月 29 日消息,用 AI 模型训练其他 AI 模型,正成为新一代 AI 实验室重点探索的方向。当地时间 28 日,Anthropic 研究员计划的一名研究人员展示了这种思路真正落地后可能呈现的样子。Anthropic 发布了最新论文《自动化研究员能够可靠缓解对齐失效》,介绍如何利用 AI 系统改善模型在一系列对齐基准测试中的表现。研究团队针对 10 种具体的失调行为设置测试,自动化系统最终让全部 10 项指标都有所改善,同时没有牺牲模型的整体能力。这套系统由 Anthropic 研究员计划成员陈岳翰(音译)领导开发,工作流程与传统科研相似。自动化系统会先查阅已有文献,提出训练方...

其他新闻

查看全部