腾讯混元联合复旦清华发布AI探索能力基准ExplorationBench
腾讯混元、复旦大学与清华大学研究人员发布ExplorationBench基准,用于衡量AI系统的探索能力。该基准构建了可验证的Alien Worlds环境,包含AlienCode(31条隐藏规则变更、70项任务)与AlienLogic(24条修补推理规则、70个定理)两个沙盒,答案由解释器或证明检查器评分。测试10个前沿AI系统发现:获得反馈比单纯思考更有效,最佳成绩从15.7%提升至89.0%;自主设计实验更优;知道规则不等于会使用规则;单一分数掩盖差异。