返回新闻列表
2026-08-26 17:33
AI123

长周期智能体编程基准测试公布:模型与执行框架呈乘法关系

ClaudeKimi模型

一份长周期Agent编程基准测试结果于2026年8月公布,量化了模型与执行框架(harness)在AI编程任务中的协同效应。测试让Agent在真实项目中连续运行数天,以人类开发者完成水平为基准衡量任务完成比例。

数据显示,Fable 5搭配Claude Code取得81.7%的成绩,Opus 5搭配Claude Code为53.6%,Kimi K3搭配Prime Agent为52.2%,Kimi K3搭配Kimi Code为45.8%,GPT-5.6 Sol搭配Codex为35.9%,Kimi K2.7搭配Kimi Code为7.2%。

结果揭示模型与harness呈乘法关系而非加法关系。同一K3模型搭配Prime Agent与Kimi Code的成绩相差6.4个百分点,说明harness的任务规划、上下文管理、错误恢复能力显著影响最终表现;同一Kimi Code harness搭配K3与K2.7的成绩相差38.6个百分点,K3相对K2.7的代际提升约6.4倍,表明模型能力是基础,模型迭代是Agent能力提升的核心驱动力。

测试还显示,K3跨harness表现稳定,搭配不同harness均取得有意义成绩,说明其长任务能力扎实。Token消耗数据亦反映工程化差异,例如K3搭配Kimi Code总Token消耗682M,搭配Prime Agent仅112M,而后者输出Token更多,使用效率更高。

来源
  1. 2026-08-25 22:05 | IT之家:2026 AI编程助手选型:模型 ×harness 乘法关系,三款终端 Agent 测试
    阅读原文

    2026 年,AI 编程工具的竞争焦点正在从代码生成质量转向 Agent 自主执行能力。短任务如生成一个函数、修复一个 bug,大多数 AI 编程工具都能完成。真正拉开差距的是长周期复杂任务 —— 从需求分析到代码实现到测试通过的完整流程,需要 Agent 具备任务规划、上下文管理、错误恢复、持续迭代等综合能力。一份长周期 Agent 编程基准的测试结果,把这种差距清晰地量化出来。这篇文章从该基准的数据切入,深入分析模型与 harness 的关系、Kimi Code 的 Agent 架构、多 Agent 协作能力、扩展生态、Kimi Work 联动和 API 生态,全面展示终端 Agent 工...

其他新闻

查看全部