微软发布智能体评测基准ThinkingBox并上线Hugging Face
微软发布智能体评测基准ThinkingBox,并已通过Hugging Face开放使用。该基准通过隔离的MCP工具会话运行AI智能体,重点评测智能体在任务完成后留下的终端后端状态与副作用,而非其生成的回答文本,并进一步检验智能体能否连续20次保持一致。
ThinkingBox覆盖零售、车险、旅行、数字银行、咨询等领域的507个有状态业务流程。每个用例从相同的干净后端状态开始,重复运行20次,以考察智能体的单次成功率与持续可靠性。官方数据显示,在12个模型共121,680次有效试验中,有79,853次未通过可执行检查,其中67.24%的失败尝试仍能正常结束、调用状态变更工具且无工具错误,但77.61%存在字段值错误。此外,约79.9%的失败可归因于工具使用问题,而非推理能力。
研究还发现,模型的一次性表现与持续可靠性存在明显落差。以全部20次通过的任务数计算,Claude Opus 5.5与Claude Opus 5均为241个(占47.53%),而部分开源模型虽具备较广的任务覆盖,但20/20通过率不足15%。微软表示,ThinkingBox的评分逻辑可迁移至生产环境,即在实际提交前检查终端状态,而不是依赖模型的自我总结。
ThinkingBox的代码采用MIT许可,基准数据采用CDLA-Permissive-2.0许可,OpenEnv环境则遵循BSD-3-Clause许可。
- 2026-10-04 06:56 | Huggingface:The Agent Said It Was Done. The Database Disagreed.阅读原文
Microsoft ThinkingBox grades AI agents on the records they leave behind, not the sentences they generate, and then asks whether they can do it twenty times in a row. It is now available through Hugging Face. Figure 1: ThinkingBox runs an agent against isolated MCP tool sessions, then grades the ter...