专题 · FULL STORY

Grok 4.6发布:性能跃升与实测

Grok 4.6经历了从Cursor误上线到正式发布并接入多款开发工具的完整进展。实测显示其性能追平竞品,性价比表现亮眼。

2026-08-11 ~ 2026-08-13 · 8 集 · 59 条

第 1 集 · 开发者实测反思AI编程:大模型仍易犯低级错误(2026-08-11,3 条)

多位开发者分享了使用 Grok 等大模型辅助编程的真实体验。实测表明,Grok 在处理边界清晰的任务时执行速度快、自主性强,但在扩展研究任务中,当前前沿大模型仍会犯低级逻辑错误,生成的代码质量较差。开发者反思指出,若缺乏人工监督,AI 编程反而会浪费时间,目前模型推理能力仍存在明显局限。

第 2 集 · Grok 4.6疑现身Cursor后撤下,官方未证实(2026-08-11,7 条)

8月11日,多名用户发现xAI的Grok 4.6模型疑似在Cursor编辑器中短暂上线,随后被迅速撤下,目前仅剩一个不可点击的选项。该版本在模型选择器中显示256k上下文和“最强模型”标签,但xAI官方尚未公布任何相关的模型卡、API列表或定价信息。鉴于Grok 4.5发布尚不足一个月,此次事件引发外界对xAI模型迭代速度的广泛关注。

已确认

  • Grok 4.6的字样确实在8月11日短暂出现在Cursor编辑器的模型选择器中,据用户反馈页面显示其具备256k上下文,并带有“最强模型”标签。
  • 该模型随后在Cursor中被暂时回滚,目前仅剩一个不可点击的选项。

尚未确认

  • 该模型是否已经开发完毕并即将发布。据@eyishazyer调查指出,目前找不到任何关于Grok 4.6的官方实质信息,此前流传的1.5T参数与1M上下文窗口等具体参数也缺乏官方依据。
  • 此次上线是Cursor的提前意外部署,还是xAI的小范围测试,目前仍无定论。

为什么重要

  • 若Grok 4.6真在未来几周内推出,这将意味着xAI在不到一个月的时间内完成了新版本的迭代,标志着其模型研发进度的重大提速。
  • 开发者社区对Grok 4.5的能力与效率给予了高度评价,市场对新版本的表现抱有强烈期待。

第 3 集 · Grok 4.6发布并开展多款编码工具横评(2026-08-11,4 条)

xAI正式发布了Grok 4.6模型,随后开发者在多款主流编程工具中对其进行了横向评测。实测对比了Cursor、Zed、T3 Code等平台,结果显示Zed虽支持运行但功能最弱,缺乏计划模式与多模态支持;而T3 Code等工具在多模型需求场景下表现更为适配。

第 4 集 · xAI 发布 Grok 4.6:性能追平 GPT-5.6 且价格不变(2026-08-12,27 条)

xAI 于 8 月 12 日正式发布 Grok 4.6 模型。该模型在保持与上一代 Grok 4.5 相同定价的前提下,实现了前沿智能水平的显著提升,在多项基准测试中跻身第一梯队。此次发布因“性能大幅跃升而价格不变”引发了行业对 xAI 模型进化速度与极高性价比的广泛关注。

已确认

  • 核心能力提升:Grok 4.6 重点升级了监督微调(SFT)和强化学习(RL),主打长程智能体与复杂视觉交互能力,能够在研究分析、代码库维护等多步骤复杂任务中保持稳定。
  • 基准测试成绩:据 Artificial Analysis 评测数据,Grok 4.6 智能指数达 61 分,追平 GPT-5.6 Sol,仅次于 Claude Opus 5 和 Claude Fable 5。马斯克确认其在 GDPVal-AA v2(ELO 达 1753 分)、AA-Briefcase 和 Harvey LAB 等多项基准测试中排名第一,并在 CursorBench、FrontendBench 等智能体编程测试中展现出强劲实力。
  • API 定价与接入:Grok 4.6 延续了极具攻击性的定价策略,输入为 2 美元/百万 token,输出为 6 美元/百万 token,缓存输入为 0.50 美元。据 @Angaisb 对比,其成本不到 GPT-5.6 Sol 的一半。
  • 可用渠道与硬件支持:模型已上线 API、Cursor 编程助手、Grove 官网 Build 功能,并已接入 NousResearch 旗下的 Hermes Agent 工具。英伟达发文祝贺并确认该模型是在英伟达 GB300 NVL72 系统上进行训练和运行的。

尚未确认

  • 据 @bindureddy 透露,Grok 4.6 即将上线大模型评测榜单 LiveBench,但其在实际编码等方面的实质性提升幅度,仍有待后续第三方评测数据验证。

为什么重要

  • 极致性价比优势:在实现能力大幅跨越、对标竞品旗舰模型的同时维持原价,为开发者提供了极具性价比的选择。马斯克也发文盛赞其为“大规模升级”,兼具高智能、高速度与高性价比。
  • 真实任务表现优异:特斯拉工程师 Julian Ibarz 实测分享称,Grok 4.6 已成为其日常主力 AI 工具,响应极快且图像处理表现出色。这表明 xAI 在模型能力上的进化速度超出了市场预期。

还有 7 条相关讨论 →

第 5 集 · AI 圈恶搞造梗虚构 Grok 4.6 发布(2026-08-12,3 条)

针对 xAI 的产品发布节奏,AI 社区在 X 平台掀起了一场集体恶搞造梗热潮。多位网友煞有介事地“宣布”发布了 Grok 4.6,并详细编造了其与虚构模型 GPT-5.6 Sol 的基准测试跑分对比。这些带有戏谑性质的推文不仅调侃了马斯克的时间线,还顺带催促推出学生版 AGI 套餐。

第 6 集 · Grok 4.6 智能体评测登顶,性价比与第一梯队表现亮眼(2026-08-12,5 条)

xAI 最新发布的 Grok 4.6 在 Artificial Analysis 的多项智能体基准测试中取得显著突破,不仅在复杂任务能力上跻身第一梯队,更在单位成本智能水平上展现出压倒性优势。

已确认

  • 基准测试成绩:在 Artificial Analysis 智能体指数中,Grok 4.6 获得 61 分,与 OpenAI 的 GPT-5.6 Sol 持平,并成功登顶榜单,与 Anthropic 的 Claude Opus 5 Max 并列第一。该测试主要评估大模型在工具调用、规划、自主性和复杂问题解决等智能体工作流方面的综合能力。
  • 长程任务表现:在 AA-Briefcase(长程智能体知识工作私有基准)中,Grok 4.6 首次亮相便取得 1577 的 Elo 分数,紧随 Claude Opus 5 之后,与 Claude Fable 5 不相上下。
  • 性价比优势:在 5 美元工作负载预算的测试中,Grok 4.6 排名第一。据 Artificial Analysis 评估,其单次任务成本仅为表现相近模型(如 Claude Fable 5)的五分之一,几乎没有其他前沿模型能在该价位提供同等智能。

为什么重要

  • Grok 4.6 的发布标志着 xAI 在智能体级别的复杂任务处理能力上已经追平头部竞品。其极高的性价比不仅为大规模部署提供了经济可行性,也可能对当前大模型市场的定价体系产生直接冲击。

第 7 集 · Grok 4.6性价比碾压竞品,下代将融合SpaceX与Cursor数据(2026-08-12,8 条)

xAI的Grok 4.6凭借惊人的性价比成为AI模型市场焦点。分析师Gavin SB Baker指出,其性能可与竞品旗舰Fable 5 Max媲美,但输入和输出token成本分别便宜80%和88%,整体价格优势达85%,在帕累托效率上占据绝对优势。Mercor在APEX平台实测后称其为最具成本效益的前沿模型之一。下一代Grok 4.7预计将融合SpaceX与Cursor数据,进一步扩大领先。

已确认

  • Gavin SB Baker认为,Grok 4.6性能与Fable 5 Max相当,但成本低85%(输入token便宜80%,输出token便宜88%)。
  • 即便OpenAI宣布降价,Grok与Cursor组合在性价比上依然具有绝对帕累托优势。
  • 市场反馈显示,初创企业和大型企业已认识到Grok的价值。
  • 基于Grok 4.5相同基座,Grok 4.6实现性能巨大飞跃。
  • Mercor实测将Grok 4.6列为最具成本效益的前沿模型之一。
  • 据Artificial Analysis数据,Grok 4.6在帕累托前沿表现优异,平均得分与GPT 5.6 Sol (max)持平,但成本低32%。
  • 据@rohanpaulai,Grok 4.6综合智能指数61分,仅比Claude Fable 5 Max的62分低1.6%,输入token价格仅为后者的1/5至1/8。

尚未确认

  • 下一代Grok 4.7规划,预计融合SpaceX数据,可能整合Cursor数据。
  • 市场观察者Chetan及部分用户认为Anthropic合作困难,GavinSBaker表示赞同。

为什么重要

  • 大幅降低的token成本与持平的旗舰性能,使AI模型竞争核心转向极致帕累托效率,直接影响企业AI基础设施选择与商业部署策略。

第 8 集 · Grok 4.6全面接入开发工具(2026-08-12,2 条)

xAI的新模型Grok 4.6在智能性和持久性上实现重大飞跃,能胜任从调试到从零构建应用的复杂开发任务。目前该模型已全面接入Grok Build、Cursor、Grok Bot及API,用户可在Cursor等编程工具中直接使用。