返回新闻列表
2026-08-14 09:17

Grok 4.6发布即登顶性价比榜:智能追平GPT-5.6 Sol,价格低60%

Grok 4.6 发布:性价比新标杆

xAI 正式发布 Grok 4.6,在 AI 智能指数上获得 61 分,追平 GPT-5.6 Sol(Max),仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。这一成绩使 Grok 4.6 一举跻身全球前沿模型第一梯队,与 OpenAI、Anthropic 的旗舰产品正面竞争。

核心改进:数据闭环 + 强化学习

Grok 4.6 在 Grok 4.5 基础上扩展训练,核心改进包括:

  • 使用模型生成的精选数据进行推理和高级技术概念训练
  • 结合高质量工程数据和改进的优化器
  • 关键变化在于数据闭环:Grok 4.5 被用于重新生成监督微调轨迹,涵盖推理、代理工具使用以及 STEM、软件工程和知识工作等领域
  • 模型在广泛的代理强化学习任务上接受训练,包括知识工作、通用编码、内核优化、网页开发和计算机辅助设计

这一策略明显瞄准了“智能体时代”的核心工作负载。

Agent 基准全面飙升

在智能体类基准测试中,Grok 4.6 表现尤为亮眼:

基准 Grok 4.6 Grok 4.5 变化
GDPval-AA v2 1753 Elo - 仅次于 Claude Opus 5
DeepSWE v1.1 65.9% 54% +11.9%
APEX-Agents 57.5% 47.1% +10.4%
Terminal-Bench v3.0 26% 15.7% +10.3%
CursorBench v3.2 69.9% - 显著突破
FrontierCode v1.1 61.3% - 显著突破

编码与代理能力均实现显著突破,长周期任务表现尤其惊人。

成本效率:用四分之一资源完成同等任务

更值得关注的是成本效率优势。Grok 4.6 定价维持在:

  • 输入:每百万 token 2 美元
  • 输出:每百万 token 6 美元

对比竞品:

  • Claude Opus 5:5 美元 / 25 美元
  • GPT-5.6 Sol:5 美元 / 30 美元

Grok 4.6 价格低 60% 以上。在 AA-Briefcase 长周期知识工作基准中,Grok 4.6 平均仅用 53 个回合和约 5 亿输入 token 完成任务,而 Claude Opus 5 需要约 103 个回合和约 20 亿 token——用不到四分之一的资源完成同等任务,性价比差距一目了然。

可用性与优惠

模型已通过以下渠道提供:

  • Cursor
  • Grok Build
  • API
  • OpenRouter、Vercel、Cloudflare 等

首周在 Grok Build 和 Cursor 中还有 2 倍用量优惠,上下文窗口维持在 50 万 token

一场围绕“同等智能、更低价格”的性价比大战已经打响。

来源: aibase阅读原文

其他新闻

查看全部