返回新闻列表
2026-05-29 10:41

英伟达推出开源 AI 框架 Polar,Codex 性能提升近 600%

文章提及的 AI 工具CodexClaude
文本核心速览
  1. 发布Polar框架英伟达推出开源AI框架Polar,旨在让Codex、Claude Code、Qwen Code等智能体框架接入GRPO训练方法,不改变原有工具调用和补丁提交方式。
  2. GRPO优化技术GRPO是一种强化学习优化技术,通过奖励信号调整模型策略,提升多步决策任务表现,主要用于代码智能体训练。
  3. Polar设计思路Polar不重写智能体框架,而是在模型API边界插入智能体,保持原有运行逻辑,记录关键数据用于训练,优化初始化、会话调度等流程。
  4. 性能与效率提升使用Polar与GRPO后,Codex在SWE-Bench Verified测试中pass@1从3.8%升至26.4%,提升594.74%;训练时间减少约5.39倍,GPU利用率显著提升。

标题:Polar让Codex的pass@1从3.8%飙到26.4%,增长594.74%

英伟达研究团队搞了一个开源AI框架叫Polar,专门让现有智能体框架(比如CodexClaude CodeQwen Code)能接入GRPO(广义相对策略优化)训练方法,而且不破坏它们原有的工具调用、上下文组织和补丁提交方式。有开发者试了说,这玩意儿直接提升了代码智能体的表现,幅度还不小。

GRPO是什么

GRPO是一种针对强化学习的优化技术,通过奖励信号来调整模型策略,帮模型在多步决策任务里学到更优的行为。在这项研究里,GRPO主要用在代码智能体的训练上,目标是让模型在实际的工具调用和补丁提交流程中不断改进表现。群里在传,智能体的强化学习正在从单步任务转向更复杂的长流程任务,比如代码仓库操作、浏览器操作、操作系统交互。这类任务依赖现有的执行框架,涉及多轮调用、工具使用、上下文管理,直接把这些框架改写成传统强化学习环境接口极其困难——容易丢失关键训练信号。

Polar不重写框架

Polar不试图重写智能体框架,而是在模型API的边界处放置智能体,保持原有运行逻辑不变。架构上,它在执行框架与推理服务器之间插入了模型智能体,兼容多种请求风格,能记录关键数据并转化为可用于训练的信息。系统层面,Polar包括任务提交会话调度状态持久化,通过优化初始化、运行和后处理的流程,显著提升训练效率。开发者测试后说,这个设计避免了改框架的坑。

效果有多猛

根据实验结果,用Polar配上GRPO训练的智能体在SWE-Bench Verified测试中性能大幅提升:Codex的pass@1分数从3.8%提升到26.4%——增长了594.74%,也就是将近6倍。效率方面,训练时间减少了约5.39倍,GPU的平均利用率也显著提升。有开发者吐槽:以前跑一次训练要等老半天,现在快多了,资源占用也降了。

接下来盯着看:其他智能体框架(Claude Code、Qwen Code)接入Polar后能不能复制这个涨幅?以及,那些还在硬改框架做强化学习的团队会不会直接转投Polar——这可能会让现有训练工具链的开发者难受。

来源: aibase阅读原文

其他新闻

查看全部