Anthropic新论文:AI系统可自动改进对齐基准,6小时胜人类专家
人工智能公司Anthropic于2026年8月28日发布新论文《Automated Researchers Can Reliably Mitigate Alignment Failures》,由研究员Chen Yueh-Han领导。论文展示了一种自动化AI研究系统,能够在10个对齐基准上逐一改进模型性能,且不降低整体性能。
该系统复现了传统研究方法的主要流程:自动搜索现有文献,提出候选方法,并用该方法对模型进行30分钟的训练,随后通过多次迭代逐步提升基准分数。有效的方法会被保留,无效的方法则被丢弃,使系统能够以较大规模快速运行。
论文指出,最佳自动化方法平均在6小时内优于人类专家提出的方法,并称“人类指导的研究方向并未带来更强的性能”。在成本方面,自动化对齐研究员(AAR)的API推理成本约为每小时4美元,而人类研究员的成本为每小时150美元。
论文同时承认了该方法的局限性:自动化系统仅在基准测试能反映实际对齐目标的前提下有效,建立并维护这些基准仍需大量工作,同时还需持续维护和扩展自动化研究员所依赖的文献库。
这项研究被视为迈向递归自我改进的一步。如果模型能够改进自身的对齐训练,未来或可更广泛地应用于改进训练实践,这也让自动化对齐后期训练可能在不远的将来变得可行。
- 2026-08-29 03:30 | TechCrunch:An Anthropic researcher just gave us a peek at self-improving AI阅读原文
Training AI models with other AI models has become a very popular goal for neolabs — and now, a researcher in Anthropic’s fellows program has given us an early look at what it might look like in practice. On Friday, Anthropic published a new paper titled “Automated Researchers Can Reliably Mitigate...