专题 · FULL STORY
Grok 4.6发布:性能跃升与实测
Grok 4.6经历了从Cursor误上线到正式发布并接入多款开发工具的完整进展。实测显示其性能追平竞品,性价比表现亮眼。
2026-08-11 ~ 2026-08-13 · 8 集 · 59 条
第 1 集 · 开发者实测反思AI编程:大模型仍易犯低级错误(2026-08-11,3 条)
多位开发者分享了使用 Grok 等大模型辅助编程的真实体验。实测表明,Grok 在处理边界清晰的任务时执行速度快、自主性强,但在扩展研究任务中,当前前沿大模型仍会犯低级逻辑错误,生成的代码质量较差。开发者反思指出,若缺乏人工监督,AI 编程反而会浪费时间,目前模型推理能力仍存在明显局限。
- 实测 Cursor 中的 Grok:速度与执行力出众,但欠缺创造力 — andrew_n_carr · 2026-08-11
- 实测对比:当前大模型均易犯低级推理错误,Grok 胜在速度快 — jsuarez · 2026-08-13
- 资深开发者反思AI编程:模型推理常犯低级错误,不如手写代码 — jsuarez · 2026-08-13
第 2 集 · Grok 4.6疑现身Cursor后撤下,官方未证实(2026-08-11,7 条)
8月11日,多名用户发现xAI的Grok 4.6模型疑似在Cursor编辑器中短暂上线,随后被迅速撤下,目前仅剩一个不可点击的选项。该版本在模型选择器中显示256k上下文和“最强模型”标签,但xAI官方尚未公布任何相关的模型卡、API列表或定价信息。鉴于Grok 4.5发布尚不足一个月,此次事件引发外界对xAI模型迭代速度的广泛关注。
已确认
- Grok 4.6的字样确实在8月11日短暂出现在Cursor编辑器的模型选择器中,据用户反馈页面显示其具备256k上下文,并带有“最强模型”标签。
- 该模型随后在Cursor中被暂时回滚,目前仅剩一个不可点击的选项。
尚未确认
- 该模型是否已经开发完毕并即将发布。据@eyishazyer调查指出,目前找不到任何关于Grok 4.6的官方实质信息,此前流传的1.5T参数与1M上下文窗口等具体参数也缺乏官方依据。
- 此次上线是Cursor的提前意外部署,还是xAI的小范围测试,目前仍无定论。
为什么重要
- 若Grok 4.6真在未来几周内推出,这将意味着xAI在不到一个月的时间内完成了新版本的迭代,标志着其模型研发进度的重大提速。
- 开发者社区对Grok 4.5的能力与效率给予了高度评价,市场对新版本的表现抱有强烈期待。
- Grok 4.6 现已在 Cursor 上线 — daniel_mac8 · 2026-08-11
- Grok 4.6 疑似在 Cursor 暂时回滚 — daniel_mac8 · 2026-08-11
- Grok 4.6 疑现身 Cursor,xAI 新模型或即将发布 — koltregaskes · 2026-08-11
- Grok 4.6 疑似意外现身 Cursor 编辑器 — testingcatalog · 2026-08-11
- Grok 4.6 提前泄露:出现在 Cursor 模型选择器,1.5T 参数 — heypearlai · 2026-08-11
- Grok 4.6疑云:除Cursor下拉菜单外无任何官方踪迹 — eyishazyer · 2026-08-11
- 曝 Grok 4.6 已现身网络,xAI 或即将发布 — koltregaskes · 2026-08-12
第 3 集 · Grok 4.6发布并开展多款编码工具横评(2026-08-11,4 条)
xAI正式发布了Grok 4.6模型,随后开发者在多款主流编程工具中对其进行了横向评测。实测对比了Cursor、Zed、T3 Code等平台,结果显示Zed虽支持运行但功能最弱,缺乏计划模式与多模态支持;而T3 Code等工具在多模型需求场景下表现更为适配。
- Grok 4.6 编程工具横评:Cursor、Zed 等四大平台实测对比 — PawelHuryn · 2026-08-11
- Grok 4.6 发布,多款主流 AI 编码工具实测对比 — PawelHuryn · 2026-08-11
- Grok 4.6 发布:五大主流 AI 编码工具实测对比与上手指南 — PawelHuryn · 2026-08-11
- Grok 4.6 上线,多模型编码工具实测横评 — PawelHuryn · 2026-08-12
第 4 集 · xAI 发布 Grok 4.6:性能追平 GPT-5.6 且价格不变(2026-08-12,27 条)
xAI 于 8 月 12 日正式发布 Grok 4.6 模型。该模型在保持与上一代 Grok 4.5 相同定价的前提下,实现了前沿智能水平的显著提升,在多项基准测试中跻身第一梯队。此次发布因“性能大幅跃升而价格不变”引发了行业对 xAI 模型进化速度与极高性价比的广泛关注。
已确认
- 核心能力提升:Grok 4.6 重点升级了监督微调(SFT)和强化学习(RL),主打长程智能体与复杂视觉交互能力,能够在研究分析、代码库维护等多步骤复杂任务中保持稳定。
- 基准测试成绩:据 Artificial Analysis 评测数据,Grok 4.6 智能指数达 61 分,追平 GPT-5.6 Sol,仅次于 Claude Opus 5 和 Claude Fable 5。马斯克确认其在 GDPVal-AA v2(ELO 达 1753 分)、AA-Briefcase 和 Harvey LAB 等多项基准测试中排名第一,并在 CursorBench、FrontendBench 等智能体编程测试中展现出强劲实力。
- API 定价与接入:Grok 4.6 延续了极具攻击性的定价策略,输入为 2 美元/百万 token,输出为 6 美元/百万 token,缓存输入为 0.50 美元。据 @Angaisb 对比,其成本不到 GPT-5.6 Sol 的一半。
- 可用渠道与硬件支持:模型已上线 API、Cursor 编程助手、Grove 官网 Build 功能,并已接入 NousResearch 旗下的 Hermes Agent 工具。英伟达发文祝贺并确认该模型是在英伟达 GB300 NVL72 系统上进行训练和运行的。
尚未确认
- 据 @bindureddy 透露,Grok 4.6 即将上线大模型评测榜单 LiveBench,但其在实际编码等方面的实质性提升幅度,仍有待后续第三方评测数据验证。
为什么重要
- 极致性价比优势:在实现能力大幅跨越、对标竞品旗舰模型的同时维持原价,为开发者提供了极具性价比的选择。马斯克也发文盛赞其为“大规模升级”,兼具高智能、高速度与高性价比。
- 真实任务表现优异:特斯拉工程师 Julian Ibarz 实测分享称,Grok 4.6 已成为其日常主力 AI 工具,响应极快且图像处理表现出色。这表明 xAI 在模型能力上的进化速度超出了市场预期。
- xAI 上线 Grok 4.6 模型 API — legit_api · 2026-08-12
- xAI 发布 Grok 4.6:主打长程智能体与视觉交互,对标 GPT-5.6 — scaling01 · 2026-08-12
- xAI 发布 Grok 4.6:1.5T 参数,编码与智能体能力大幅提升 — Daniel_Farinax · 2026-08-12
- Grok 4.6 智能体评测追平 GPT-5.6,编程能力实现大幅跨越 — kimmonismus · 2026-08-12
- Grok 4.6 跑分追平 GPT-5.6,智能体性能居前沿且成本极低 — ArtificialAnlys · 2026-08-12
- Grok 4.6 发布,在 GDPVal-AA v2 基准测试中击败 GPT-5.6 — XFreeze · 2026-08-12
- Grok 4.6 正式发布:同价格下带来前沿智能大幅提升 — andersonbcdefg · 2026-08-12
- Grok 4.6 跑分曝光:编码能力领先,但 SWE 仍存短板 — kimmonismus · 2026-08-12
- 马斯克确认 Grok 4.6 登顶 GDPVal-AA 榜单,ELO 达 1753 分 — elonmusk · 2026-08-12
- xAI 发布 Grok 4.6:兼具 Opus 级智能与低成本 — soleio · 2026-08-12
- 马斯克盛赞 Grok 4.6:多项基准测试位列第一 — elonmusk · 2026-08-12
- xAI 正式发布 Grok 4.6:同价位下性能大幅提升 — xiaosun86 · 2026-08-12
- xAI 发布 Grok 4.6,已上线 Cursor 与 Grok Build — mark_k · 2026-08-12
- Grok 4.6 跑分登顶多项基准,定价与上代持平 — XFreeze · 2026-08-12
- Grok 4.6 实测:性能比肩 Sol,成本仅为竞品五分之一 — daniel_mac8 · 2026-08-12
- Grok 4.6 跑分曝光:性能大涨,价格不变 — mark_k · 2026-08-13
- Grok 4.6 上线 API:输入每百万 token 仅 2 美元 — XFreeze · 2026-08-13
- Grok 4.6 发布并登陆 LiveBench,定价与 4.5 持平 — bindureddy · 2026-08-13
- Grok 4.6 评测惊艳:性能比肩竞品,成本仅需五分之一 — daniel_mac8 · 2026-08-13
- Grok 4.6 与 GPT-5.6 Sol 评测同分,成本不到其一半 — Angaisb_ · 2026-08-13
第 5 集 · AI 圈恶搞造梗虚构 Grok 4.6 发布(2026-08-12,3 条)
针对 xAI 的产品发布节奏,AI 社区在 X 平台掀起了一场集体恶搞造梗热潮。多位网友煞有介事地“宣布”发布了 Grok 4.6,并详细编造了其与虚构模型 GPT-5.6 Sol 的基准测试跑分对比。这些带有戏谑性质的推文不仅调侃了马斯克的时间线,还顺带催促推出学生版 AGI 套餐。
- 网友恶搞虚构 Grok 4.6 跑分,喊话马斯克求学生版 AGI — felpix_ · 2026-08-12
- Grok 4.6 发布?AI 圈集体玩梗伪造模型更新 — kimmonismus · 2026-08-12
- 网友造梗调侃 xAI 发布节奏:Grok 4.6 已来,Fable 5.1 遥无期 — patience_cave · 2026-08-13
第 6 集 · Grok 4.6 智能体评测登顶,性价比与第一梯队表现亮眼(2026-08-12,5 条)
xAI 最新发布的 Grok 4.6 在 Artificial Analysis 的多项智能体基准测试中取得显著突破,不仅在复杂任务能力上跻身第一梯队,更在单位成本智能水平上展现出压倒性优势。
已确认
- 基准测试成绩:在 Artificial Analysis 智能体指数中,Grok 4.6 获得 61 分,与 OpenAI 的 GPT-5.6 Sol 持平,并成功登顶榜单,与 Anthropic 的 Claude Opus 5 Max 并列第一。该测试主要评估大模型在工具调用、规划、自主性和复杂问题解决等智能体工作流方面的综合能力。
- 长程任务表现:在 AA-Briefcase(长程智能体知识工作私有基准)中,Grok 4.6 首次亮相便取得 1577 的 Elo 分数,紧随 Claude Opus 5 之后,与 Claude Fable 5 不相上下。
- 性价比优势:在 5 美元工作负载预算的测试中,Grok 4.6 排名第一。据 Artificial Analysis 评估,其单次任务成本仅为表现相近模型(如 Claude Fable 5)的五分之一,几乎没有其他前沿模型能在该价位提供同等智能。
为什么重要
- Grok 4.6 的发布标志着 xAI 在智能体级别的复杂任务处理能力上已经追平头部竞品。其极高的性价比不仅为大规模部署提供了经济可行性,也可能对当前大模型市场的定价体系产生直接冲击。
- Grok 4.6 登顶部分智能体基准,长程任务表现紧追 Claude Opus — ArtificialAnlys · 2026-08-12
- Grok 4.6 智能体榜单登顶,与 Claude Opus 5 Max 并列第一 — XFreeze · 2026-08-13
- Grok 4.6 智能体评测逼近 Claude Fable 5,单次任务成本仅其五分之一 — ArtificialAnlys · 2026-08-13
- Grok 4.6在5美元预算下AI模型评测登顶,性价比突出 — XFreeze · 2026-08-13
- Grok 4.6 智能指数达 61,追平 GPT-5.6 跻身第一梯队 — aman_madaan · 2026-08-13
第 7 集 · Grok 4.6性价比碾压竞品,下代将融合SpaceX与Cursor数据(2026-08-12,8 条)
xAI的Grok 4.6凭借惊人的性价比成为AI模型市场焦点。分析师Gavin SB Baker指出,其性能可与竞品旗舰Fable 5 Max媲美,但输入和输出token成本分别便宜80%和88%,整体价格优势达85%,在帕累托效率上占据绝对优势。Mercor在APEX平台实测后称其为最具成本效益的前沿模型之一。下一代Grok 4.7预计将融合SpaceX与Cursor数据,进一步扩大领先。
已确认
- Gavin SB Baker认为,Grok 4.6性能与Fable 5 Max相当,但成本低85%(输入token便宜80%,输出token便宜88%)。
- 即便OpenAI宣布降价,Grok与Cursor组合在性价比上依然具有绝对帕累托优势。
- 市场反馈显示,初创企业和大型企业已认识到Grok的价值。
- 基于Grok 4.5相同基座,Grok 4.6实现性能巨大飞跃。
- Mercor实测将Grok 4.6列为最具成本效益的前沿模型之一。
- 据Artificial Analysis数据,Grok 4.6在帕累托前沿表现优异,平均得分与GPT 5.6 Sol (max)持平,但成本低32%。
- 据@rohanpaulai,Grok 4.6综合智能指数61分,仅比Claude Fable 5 Max的62分低1.6%,输入token价格仅为后者的1/5至1/8。
尚未确认
- 下一代Grok 4.7规划,预计融合SpaceX数据,可能整合Cursor数据。
- 市场观察者Chetan及部分用户认为Anthropic合作困难,GavinSBaker表示赞同。
为什么重要
- 大幅降低的token成本与持平的旗舰性能,使AI模型竞争核心转向极致帕累托效率,直接影响企业AI基础设施选择与商业部署策略。
- Grok 4.6 性价比碾压竞品,下代 4.7 将融合 SpaceX 数据 — GavinSBaker · 2026-08-12
- 曝 Grok 4.6 性能比肩竞品且价格暴降 85% — GavinSBaker · 2026-08-13
- 称 Grok 性价比碾压 OpenAI:价格便宜 85% 性能持平 — GavinSBaker · 2026-08-13
- Grok 4.6 性能比肩竞品且价格低 85%,下代将整合 Cursor 数据 — altryne · 2026-08-13
- Grok与Cursor展现帕累托优势,Anthropic被指合作困难 — GavinSBaker · 2026-08-13
- Grok 4.6 性价比对标 GPT 5.6,前沿开源模型反陷高价困境 — downingARK · 2026-08-13
- Mercor 实测称 Grok 4.6 为最具性价比的前沿模型之一 — GavinSBaker · 2026-08-13
- Grok 4.6 智能指数紧咬 Claude Fable 5,输入输出 token 价格便宜 5 至 8 倍 — rohanpaul_ai · 2026-08-13
第 8 集 · Grok 4.6全面接入开发工具(2026-08-12,2 条)
xAI的新模型Grok 4.6在智能性和持久性上实现重大飞跃,能胜任从调试到从零构建应用的复杂开发任务。目前该模型已全面接入Grok Build、Cursor、Grok Bot及API,用户可在Cursor等编程工具中直接使用。
- Grok 4.6 已接入 Cursor 编程助手 — prasenx · 2026-08-12
- Grok 4.6 全面接入 Devin、Cursor 等开发工具 — elonmusk · 2026-08-13