2026-10-05 19:06
AI123

大模型自学下棋实验结果分化:Claude Opus 5.5升至1760分,GPT-6 Astra跌至1400分

Arena的AI能力负责人Peter Gostev于2026年10月5日公布了一项“AI自学下棋”实验:Claude Opus 5.5与GPT-6 Astra分别与国际象棋引擎Stockfish完成200盘对局,过程中不更新模型参数,而是依靠自行记录笔记来累积经验。

Stockfish是目前最强的开源国际象棋引擎,实验中被分为Skill 0、限至1800分和满血三档,模型可自行选择对手难度。作者尽量减少干预,唯一禁令是不准调用象棋引擎替自己下棋。结果显示,Opus 5.5在前75盘一直处于1450至1550分区间,随后逐步上升,第150盘约为1790分,第194盘回落至1760分,较开局约1500分提升明显。Astra则从第29盘的高点1810分一路下滑,100盘后约1680分,200盘结束仅剩约1400分。对阵满血版Stockfish时,Astra的68盘全部告负。

Gostev指出,Elo分数按最近50盘对阵Skill 0和1800分档的战绩估算,满血档不参与计算,因此该分数主要用于观察模型在实验中的进步趋势。他评价Opus 5.5的表现“非常亮眼”,并已核实其未调用象棋引擎作弊;对于Astra的退步,他推测可能与Codex配置下272k上下文窗口内笔记和文件增多后的处理退化有关,但仍需对照实验验证。

这项测试旨在观察大模型在不改变权重的情况下,能否通过上下文中的笔记与复盘在实战中自我强化。目前GPT-6.1 Sol和Claude Fable 5.1也已加入实验,分别采用828K上下文窗口和另一配置,但样本量尚少。

来源
  1. 2026-10-05 18:36 | 新浪财经:放养AI练棋,Claude暴涨250分!GPT-6越练越菜
    阅读原文

    放养两个AI,让它们自己练棋,结果走出了两条完全相反的曲线。Claude Opus 5.5前75盘还在1500分上下打转,可200盘下完,分数已经涨到1760。同一张榜上,GPT-6 Astra就有点惨了。第29盘还有1810分,下完200盘,却只剩1400分。对阵满血Stockfish,它下了68盘,一盘都没赢。这轮实验里,没有人为它们设计练棋课程,也没有更新模型参数。同样是自己练,Opus越练越猛,Astra却越练越回去。这场「AI自学下棋」的实验,出自大模型竞技场Arena的AI能力负责人Peter Gostev之手,一放出来就在X上炸了。还有网友一眼认出来,这不就是三年前Reddit上...

其他新闻

查看全部