2026-09-30 23:10
AI123

腾讯混元联合复旦清华发布AI探索能力基准ExplorationBench

腾讯混元与复旦大学、清华大学的研究人员联合发布了ExplorationBench,这是一个用于衡量AI系统探索能力的新基准。该基准构建了可验证的Alien Worlds环境,包含AlienCode与AlienLogic两个沙盒:AlienCode包含31条隐藏规则变更和70项任务,AlienLogic则包含24条修补推理规则和70个定理。所有答案均由解释器或证明检查器自动评分,不依赖大模型裁判,确保结果客观可复现。

研究人员对10个前沿AI系统进行了测试,得出四项关键发现:第一,获得反馈比单纯思考更有效,在AlienCode上,最佳成绩从初始的15.7%提升至四轮后的89.0%,而无反馈的同轮次表现仅为0.5%至11.0%;第二,自主设计实验显著影响表现,即使将系统自己选择的最优探针回放给同一系统,9个系统在AlienCode上的成绩反而下降;第三,知道规则不等于会使用规则,即便所有必要规则均被正确给出,任务解决率仅为73.4%;第四,单一综合分数会掩盖重要差异,同一系统在相同预算下的成绩区间为5.7%至79.0%,且排名在两个世界间几乎没有迁移性。

目前,论文、网站及排行榜已公开,代码即将发布。

来源
  1. 2026-09-30 21:29 | X:New Research: We are releasing ExplorationBench, a benchmark for measuring how AI systems explore. Scientific discovery begins where known problems en...
    阅读原文

    New Research: We are releasing ExplorationBench, a benchmark for measuring how AI systems explore.Scientific discovery begins where known problems end: a system has to frame hypotheses, design experiments, and learn from the results. Evaluating this is hard. Genuinely new answers cannot be checked q...

其他新闻

查看全部