返回新闻列表
2026-08-13 09:45

Grok 4.6正式发布,综合实力追平GPT-5.6 Sol

文本核心速览
  1. Grok 4.6正式发布SpaceX AI推出旗舰模型Grok 4.6,专注长程Agent任务,综合成绩在Artificial Analysis九项基准中追平GPT-5.6 Sol,仅次于Claude Opus 5与Fable 5 Max。
  2. 训练聚焦长程任务在Grok 4.5基础上优化,大量采用高质量推理、工程代码数据,并通过覆盖知识工作、编程和专属领域的强化学习训练,强化长程Agent能力。
  3. 长程推理跻身顶尖在GDPval-AA v2测试中Elo得分1753,仅次于Claude Opus 5;AA-Briefcase长程知识工作得分1577,亦排第二,显示逻辑与长程执行能力达世界顶尖。
  4. 性能定价保持优势Grok 4.6运行速度达80 TPS;基础版输入每百万Token 2美元、输出6美元,高速版翻倍,价格具竞争力。
  5. 现已开放接入Cursor与Grok Build用户可立即体验,开发者可通过API接入并集成至应用或工作流。

发布概述

近日,SpaceX AI正式推出全新升级的旗舰级人工智能模型 Grok 4.6。该模型专为处理复杂、长程的 Agent 任务而设计,在多项核心基准测试中展现出与 OpenAI 旗舰模型 GPT-5.6 Sol 相媲美甚至超越的强劲实力。

技术演进

回顾其技术路线,SpaceX AI 曾在 7 月份联合 Cursor 推出了由数万张英伟达 GB300 GPU 算力支持训练的 Grok 4.5。在此基础上,Grok 4.6 实现了进一步飞跃,其训练重点针对长程复杂任务进行了全面优化:

  • 大量采用涵盖推理能力、高级技术概念以及高质量工程代码的模型生成数据。
  • 接受广泛的 Agent 强化学习训练,覆盖知识工作、通用编程及多个专属领域环境。
  • 在构建视觉和交互式应用时能够输出更优质的初始效果。

基准测试成绩

在权威评测机构 Artificial Analysis 涵盖九项热门 AI 基准测试的综合指数中,Grok 4.6 的综合成绩已经追平 GPT-5.6 Sol,目前仅落后于 Claude Opus 5Fable 5 Max。具体关键表现如下:

测试项目 Elo 得分 排名表现
GDPval-AA v2(逻辑与知识) 1753 仅次于 Claude Opus 5
AA-Briefcase(长程知识工作) 1577 仅次于 Claude Opus 5

上述结果表明,Grok 4.6 在逻辑推理和长程任务执行方面已跻身世界顶尖水平。

性能与价格

Grok 4.6 在带来显著性能升级的同时,继续保持了极具竞争力的运行速度与价格体系:

  • 运行速度:可达 80 TPS(每秒处理 Token 数)。
  • 基础版价格:输入每百万 Token 2 美元,输出每百万 Token 6 美元
  • 高速变体版价格:输入每百万 Token 4 美元,输出每百万 Token 12 美元
// 示例:通过 API 调用 Grok 4.6(伪代码)
const response = await grok.chat.completions.create({
  model: "grok-4.6",
  messages: [{ role: "user", content: "复杂任务指令" }],
  speed: "high" // 可选高速模式
});

可用性与接入

目前,CursorGrok Build 用户已经可以直接上手体验 Grok 4.6。广大开发者也可以通过 API 进行便捷接入,将其集成到自己的应用或工作流中。

总结

Grok 4.6 的发布标志着 SpaceX AI 在长程 Agent 任务领域迈出了重要一步。凭借追平 GPT-5.6 Sol 的综合实力、优秀的运行速度以及亲民的价格策略,它有望在 AI 应用市场中获得广泛采用。未来,随着更多开发者基于该模型构建创新应用,AI Agent 的能力边界将进一步拓展。

来源: aibase阅读原文

其他新闻

查看全部