2026-08-13 09:45
Grok 4.6正式发布,综合实力追平GPT-5.6 Sol
文本核心速览
- Grok 4.6正式发布—SpaceX AI推出旗舰模型Grok 4.6,专注长程Agent任务,综合成绩在Artificial Analysis九项基准中追平GPT-5.6 Sol,仅次于Claude Opus 5与Fable 5 Max。
- 训练聚焦长程任务—在Grok 4.5基础上优化,大量采用高质量推理、工程代码数据,并通过覆盖知识工作、编程和专属领域的强化学习训练,强化长程Agent能力。
- 长程推理跻身顶尖—在GDPval-AA v2测试中Elo得分1753,仅次于Claude Opus 5;AA-Briefcase长程知识工作得分1577,亦排第二,显示逻辑与长程执行能力达世界顶尖。
- 性能定价保持优势—Grok 4.6运行速度达80 TPS;基础版输入每百万Token 2美元、输出6美元,高速版翻倍,价格具竞争力。
- 现已开放接入—Cursor与Grok Build用户可立即体验,开发者可通过API接入并集成至应用或工作流。
发布概述
近日,SpaceX AI正式推出全新升级的旗舰级人工智能模型 Grok 4.6。该模型专为处理复杂、长程的 Agent 任务而设计,在多项核心基准测试中展现出与 OpenAI 旗舰模型 GPT-5.6 Sol 相媲美甚至超越的强劲实力。
技术演进
回顾其技术路线,SpaceX AI 曾在 7 月份联合 Cursor 推出了由数万张英伟达 GB300 GPU 算力支持训练的 Grok 4.5。在此基础上,Grok 4.6 实现了进一步飞跃,其训练重点针对长程复杂任务进行了全面优化:
- 大量采用涵盖推理能力、高级技术概念以及高质量工程代码的模型生成数据。
- 接受广泛的 Agent 强化学习训练,覆盖知识工作、通用编程及多个专属领域环境。
- 在构建视觉和交互式应用时能够输出更优质的初始效果。
基准测试成绩
在权威评测机构 Artificial Analysis 涵盖九项热门 AI 基准测试的综合指数中,Grok 4.6 的综合成绩已经追平 GPT-5.6 Sol,目前仅落后于 Claude Opus 5 与 Fable 5 Max。具体关键表现如下:
| 测试项目 | Elo 得分 | 排名表现 |
|---|---|---|
| GDPval-AA v2(逻辑与知识) | 1753 | 仅次于 Claude Opus 5 |
| AA-Briefcase(长程知识工作) | 1577 | 仅次于 Claude Opus 5 |
上述结果表明,Grok 4.6 在逻辑推理和长程任务执行方面已跻身世界顶尖水平。
性能与价格
Grok 4.6 在带来显著性能升级的同时,继续保持了极具竞争力的运行速度与价格体系:
- 运行速度:可达 80 TPS(每秒处理 Token 数)。
- 基础版价格:输入每百万 Token 2 美元,输出每百万 Token 6 美元。
- 高速变体版价格:输入每百万 Token 4 美元,输出每百万 Token 12 美元。
// 示例:通过 API 调用 Grok 4.6(伪代码)
const response = await grok.chat.completions.create({
model: "grok-4.6",
messages: [{ role: "user", content: "复杂任务指令" }],
speed: "high" // 可选高速模式
});
可用性与接入
目前,Cursor 与 Grok Build 用户已经可以直接上手体验 Grok 4.6。广大开发者也可以通过 API 进行便捷接入,将其集成到自己的应用或工作流中。
总结
Grok 4.6 的发布标志着 SpaceX AI 在长程 Agent 任务领域迈出了重要一步。凭借追平 GPT-5.6 Sol 的综合实力、优秀的运行速度以及亲民的价格策略,它有望在 AI 应用市场中获得广泛采用。未来,随着更多开发者基于该模型构建创新应用,AI Agent 的能力边界将进一步拓展。
来源: aibase阅读原文