专题 · FULL STORY

Grok 4.5发布:主打编程与高性价比

马斯克高调官宣后,xAI发布Grok 4.5模型。新模型主打编程与智能体场景,凭借极低Token消耗与高响应速度,在多项基准测试中登顶,并迅速接入主流工具,获社区大量好评。

2026-07-07 ~ 2026-07-16 · 20 集 · 227 条

第 1 集 · 马斯克官宣Grok 4.5发布,1.5万亿参数强化编码(2026-07-07,25 条)

马斯克于7月8日宣布,基于Beta测试客户的强烈正面反馈,xAI将于次日向公众发布Grok 4.5模型。他宣称该模型达到了Opus级别的性能,但运行速度更快、token效率更高且成本更低。这一官方消息印证了近日网络上铺天盖地的爆料。

关键细节与传闻汇总

在官方确认前,多名爆料者与测试账号已透露大量细节。据@tetsuoai与@XFreeze等整理的信息,Grok 4.5运行在全新的V9基座模型上,参数规模达到1.5万亿,是此前V8-small(0.5万亿)的三倍,也是xAI迄今发布的最大模型。训练重点放在了编码和智能体任务上。此外,@nimaowji与@testingcatalog等发现Grok网页端已出现4.5版本的痕迹,@markk则爆料该模型在发布初期将仅限SuperGrok Heavy订阅用户进行早期访问。

深度联手Cursor

多方消息指出xAI此次与编程工具Cursor进行了深度联动。据@kimmonismus与@ns123abc等转述的内部备忘录及媒体报道,双方联合开发了这款大模型,旨在关键领域直接对标Opus 4.8与GPT 5.5。@haider1补充称模型训练了Cursor数据,以提升智能体编程能力。不过@Angaisb表示,虽然对xAI不抱期待,但看好Cursor的优化能力。

后续模型路线图

在公布Grok 4.5的同时,马斯克(@elonmusk)还透露了后续研发计划。他表示Grok Build harness和1.5T基座模型会根据用户需求持续改进,而参数规模更大的Grok 2T模型将在本月完成训练,预计于下个月向客户提供。

还有 5 条相关讨论 →

第 2 集 · 预测市场高度押注Grok 4.4近期发布(2026-07-07,2 条)

预测市场Polymarket上,关于xAI推出Grok 4.4的押注持续升温:其在7月17日前发布的合约概率一度达94%,月底前发布的合约也达84%。这些数字反映出市场对新版模型近期上线的强烈预期,但仍非官方确认。

第 3 集 · Grok 4.5 发布主打编程与低价(2026-07-08,61 条)

xAI 正式发布了 Grok 4.5 模型,主要面向编程与智能体场景。该模型以极具竞争力的低价切入市场,并在发布后迅速登陆各大模型评测榜单与编程工具,引发了社区的广泛关注与积极反馈。

定价与可用渠道

Grok 4.5 的定价为每百万 token 输入 2 美元、输出 6 美元。该模型已确认上线 Grok Build、Cursor 和 SpaceXAI 控制台。在 Cursor 中,其 Fast mode(快速模式)定价为输入 4 美元、输出 18 美元每百万 token。

评测表现与榜单成绩

在 Artificial Analysis 评测中,Grok 4.5 获得 54 分,在 Intelligence Index 排名第四,仅次于部分 Claude、GPT 和 Fable 系列模型。在针对真实知识工作任务的评测中,其平均每个任务成本约 0.49 至 1.12 美元,耗时约 12.4 分钟。马斯克转发称其在部分基准测试中排名第一。此外,在 CritPt 编程评测中,其表现介于 Opus 4.6-7 与 4.8 之间。

实际反馈与性价比优势

多位用户与博主强调了该模型的高性价比。有测试指出其编程能力可与 GPT-5.5-xhigh 相当,但成本仅为一半;在真实任务中的成本比 Opus 4.8 便宜约 17 倍。在 Cursor 的实测反馈中,用户认为它在“构思到实现”的流程中体验优良,整体感觉像一个更快、更便宜的 Opus 4.8。分析认为,这与模型在高质量编码轨迹上训练,并深度融合了 Cursor 数据密切相关。

还有 41 条相关讨论 →

第 4 集 · xAI发布Grok 4.5:主打编程与智能体,对标Opus(2026-07-09,55 条)

7月9日,xAI正式发布了Grok 4.5模型。官方将其描述为首个专门针对编程和智能体任务训练的模型,并与Cursor合作进行训练。该模型主要面向真实的工程任务,擅长处理大代码库、跨多个仓库的长任务,以及多技能和多工具的编排。埃隆·马斯克表示,内部评估认为Grok 4.5的能力大致可与Claude Opus 4.7相当,但速度更快、成本更低,能提供单位时间与成本下的最高智能。

核心参数与定价

Grok 4.5支持50万(500K)token的上下文窗口,速度达到80 tokens/s,并支持工具调用、结构化输出和视觉(图像转文本)等功能。API定价方面,输入价格为每百万token 2美元,输出为每百万token 6美元。此外,该模型在输出上极为省token,在SWE Bench Pro测试中,其平均输出token(15,954个)远低于Claude Opus 4.8 max(67,020个),约节省4.2倍。

平台可用性

目前,Grok 4.5已全面上线并开始推送。用户可以通过grok.com聊天端、Grok Build(需更新至0.2.92版本)、Cursor的全部方案、Hermes Agent、OpenClaw以及xAI API和OpenRouter等网关平台体验该模型。不过,欧盟地区预计要到7月中旬才能上线。

还有 35 条相关讨论 →

第 5 集 · Grok 4.5 发布获大量好评:速度快、编码强(2026-07-09,13 条)

近期 Grok 4.5 的发布在 AI 社区引发了广泛关注,大量用户在实测后给出了极高的正面评价。这标志着 Grok 系列模型在能力上实现了显著跨越,不再被视为单纯的边缘产品,而是正式跻身严肃的前沿模型竞争行列。

核心体验与性能反馈

多位用户(如 @tetsuoai、@markk、@StarKnight12)一致认为 Grok 4.5 的表现“出乎意料地好”。在具体应用场景上,@xiaohu 指出它在简单任务、写作和前端任务上体验接近更高水平,且速度极快、API 价格便宜。@DanielFarinax 在连续 24 小时高强度使用后,称其执行想法时几乎没有摩擦,体验具有碾压性优势,甚至表示愿意因此取消 Claude Max 订阅改用 Grok Heavy。@chrisfirst 也直观感受到它相比上一代 Grok 4 有了立竿见影的提升。

编码能力与工作流融合

Grok 4.5 在编程方面的表现尤为受认可。@mariofilhoml 专门针对其编码能力给出了“surprisingly good”的评价,社群中也有声音认为其编码能力很能打。此外,@tylerbruno05 赞赏了其 build TUI 的体验,@markk 则报告称该模型在 AI 代码编辑器 Cursor 中的实际使用表现非常出色。

横评对比与综合定位

在与其他主流模型的横向对比中,@HarveenChadha 给出了大致排序,认为其实际体验配得上外界的期待,整体水平与 GLM 5.2 接近。@maxpaperclips 等用户也感叹,Grok 终于摆脱了以往“玩笑式存在”的标签,成为了一个真正认真且能打的模型。

第 6 集 · Grok 4.5发布并登上Vals榜单第六名(2026-07-09,2 条)

Grok 4.5正式发布,并在Vals Index榜单上取得第六名,得分达到65.3%。与上一代Grok模型相比,新版本在基准测试中的得分提升了近20个百分点。这一显著的榜单表现提升被业界视为一个令人印象深刻的进步,展示了该模型在能力上的大幅跨越。

第 7 集 · Grok 4.5 模型正式接入 Notion(2026-07-09,2 条)

Notion 宣布正式接入 Grok 4.5 模型,用户可以直接在应用内使用该模型来管理会议、文档和公司知识。Notion 团队表示,这是他们测试过的最强 Grok 模型,相比上一代 Grok 4.3 有了显著提升,尤其是在处理搜索密集型任务时表现出了更优异的性能。

第 8 集 · 马斯克称Grok 4.5兼具高性能与低门槛(2026-07-09,3 条)

埃隆·马斯克近期多次发文力挺Grok 4.5,强调其具备“最佳真实世界ROI”。得益于terafab和特斯拉FSD团队的高效模式,该模型在低effort模式下依然表现出色,几乎无质量损失且速度最快。这种将前沿智能与低门槛结合的策略,旨在让更多用户受益,同时显著节省算力消耗。

第 9 集 · Grok 4.5 领跑多项专业基准测试(2026-07-10,5 条)

根据 Artificial Analysis 发布的最新 AI 知识工作基准结果,Grok 4.5 展现出了强大的专业领域实力,成为目前表现最好的非 Anthropic 模型。这一成绩引起了 AI 社区的关注,证明了其在复杂任务中的竞争力。

关键细节

Grok 4.5 在多项专业工作基准测试中取得了领先成绩。据 @kevinnbass 总结,该模型的分数显著优于 Opus 4.8 和 GPT 5.5 等其他前沿模型。@XFreeze 的详细数据指出,Grok 4.5 拿下了多个细分榜单的第一名,包括 AutomationBench-AA、Terminal-Bench v2、Harvey Legal Agent Benchmark、SWE Marathon 和 SWE-Atlas 等。

优势领域

多位作者均特别强调了 Grok 4.5 在法律任务上的卓越表现。无论是在综合评价还是具体的 Harvey Legal Agent Benchmark 中,该模型都展现出了处理专业法律工作的突出能力。

第 10 集 · Grok 4.5登顶编码基准且Token消耗极低(2026-07-10,3 条)

xAI的Grok 4.5搭配Grok Build在SWE-Atlas-QnA编码基准上得分84,与Codex GPT-5.6并列第一。除了基准测试表现优异,该方案在编码智能体配置中还展现出极高的Token效率,每个任务消耗远低于主流竞品,标志着xAI在编程与智能体领域的竞争力显著提升。

第 11 集 · Grok 4.5 开放免费试用并接入开发工具(2026-07-10,9 条)

7月10日至11日,xAI 旗下 Grok 官方宣布 Grok 4.5 模型正式向免费用户开放试用。用户只需使用 X 或 SuperGrok 账号,即可在 Grok Build 平台体验该模型并向官方提供反馈。这一动作降低了开发者的体验门槛,迅速引发社区关注。

模型定位与开发工具接入

埃隆·马斯克在转发官方消息时特别强调,Grok 4.5 是一款全新的 Opus-class(大杯级)模型,其核心优势在于“速度快、成本低”,非常契合真实世界的编程与工程任务需求。为了方便开发者使用,SpaceXAI 宣布 Grok 4.5 可以在 Grok Build CLI 和 Cursor 中免费调用,社区分享的安装方式甚至提供了直接的 curl 命令行启动脚本。

Grok Build 同步版本更新

伴随 Grok 4.5 的开放,Grok Build 也迎来了 0.2.95 版本更新。据开发者 @markk 总结,本次更新包含多项具体功能改进,例如支持通过 managedconfig.toml 文件为团队定义默认允许的命令等,进一步提升了团队协作与工具管理的灵活性。

第 12 集 · Grok 4.5 接入 Perplexity 编排系统并登顶 WANDR 评测(2026-07-11,10 条)

近期,xAI 的 Grok 4.5 正式接入 Perplexity 系统,成为 Perplexity Computer 面向 Consumer Pro/Max 订阅用户提供的编排模型。这一动态不仅标志着两家公司在产品层面的深度整合,也因 Grok 4.5 在内部基准测试中展现出的压倒性优势而备受关注。

评测数据与表现

在 Perplexity 的 WANDR 基准测试中,Grok 4.5 与另外 5 种编排配置进行了对比。结果显示,Grok 4.5 拿到了 0.328 的最高分,成为表现最强的前沿模型,其单次试验成本约为 4.76 美元。Perplexity 的 Arav Srinivas 对其表现印象深刻,而 Elon Musk 则强调,Grok Build 和 Grok 4.5 最大的价值在于它们在真实工作场景中“确实非常有用”。

实际应用反馈

在真实用户体验方面,用户 @BWay124 对搭载 Grok 4.5 (High) 的 Grok Build 进行了实测。该用户指出,Grok Build 达到了全新高度,能够适应任何终端、项目或代码库环境。只需输入目标并解除障碍,它即可自主完成后续工作,例如首次顺畅地通过自主 CLI 操作执行数据库修改和查询等任务。同时,该用户也建议未来能支持跨终端或代码库无缝恢复对话,以便在不同层级间更好地工作。

第 13 集 · Grok 4.5编码能力大幅提升,执行明确任务速度极快(2026-07-11,2 条)

近期用户体验显示,Grok 4.5在编码能力上取得了显著进步,甚至能一次性生成完整的代码或成品。虽然它可能尚未达到顶尖的通用智能水平,但在处理定义明确的编码任务时,Grok 4.5展现出了极快的执行速度与出色的实操能力,获得了开发者的高度认可。

第 14 集 · Grok 4.5 评测:中高预算段性价比突出(2026-07-11,5 条)

近期,针对 Grok 4.5 的多项实测与开发者反馈表明,该模型在成本与性能的综合权衡上表现突出,尤其在特定预算区间和实际生产应用中展现出极高的可用性。

关键细节与性能表现

Xbow 的研究团队在评估后指出,Grok 4.5 并非在所有价位都最强,但在“预算不至于太紧、又在意成本”的中高成本区间里,是他们测试过的最强选项。在具体的浏览器任务评测中,有反馈称其表现已超过 GPT-5.6-Sol,并仅略低于 Opus。不过,由于缓存输入价格昂贵,其整体成本仅比 Opus 低约 10%。

开发者反馈与生产应用

开发者 @zeeg 分享了他在安全评测中的体验,认为 Grok 4.5 表现不错。他目前仍在使用 Sonnet 4.6,但考虑到价格与准确率的权衡,他极有可能在 Warden 的生产环境中改用 Grok,因为该模型在当前价格点上的准确率表现“非常出色”。此外,@amanmadaan 转发的观点也印证了这一结论:单一自动化评测无法完整衡量模型可用性,而 Grok 4.5 在实测中持续位居成本-性能 Pareto 前沿。

第 15 集 · Grok 4.5 体验获好评:速度亮眼跻身顶级梯队(2026-07-11,2 条)

近期多位用户在试用 Grok 4.5 后给出积极评价。有长期使用其他模型的用户反馈,切换至 Grok 4.5 作为日常主力后,不仅响应速度明显提升,智能水平也与原先模型相当甚至更好。另有测试者表示该模型体验令人惊艳,虽未断言已超越 Claude Opus 等顶级模型,但其综合表现已足够强劲,足以与这些头部模型相提并论。

第 16 集 · Grok 4.5 首批实测:更快更省,杀入编程工作流(2026-07-12,8 条)

Grok 4.5 在 7 月中旬发布后,集中迎来一批开发者与评测者的第一手反馈,结论高度趋同:相比前代与同档竞品,它更快、更便宜、且足够聪明,正以高性价比姿态进入 Cursor、Amp 等编程工作流。「更快更省」几乎成为这批反馈的最大公约数。

评测成绩与性价比

rasbt 在更新后的对比表中将 Grok 4.5 与 Meta 的 Muse Spark 1.1 一并纳入,认为前者处在性价比的帕累托前沿,整体性价比很高。一条被马斯克转发的视频工作室评测显示,其成绩从 6/33 跃升至 23/33,成本效率被形容为非常突出。另有转述称,Grok 4.5 在浏览器使用场景已达到 Claude Opus 级别,并在一项评测中超过 GPT-5.6-Sol、接近 Opus;不过由于缓存输入成本较高,整体只比 Opus 便宜约 10%,速度则略快。zeeg 在补做周末基准后表示看法未变,仍认为 Grok 4.5 可能是最划算的选择,同时提到 GPT 5.6 Luna 在 Warden 的 security bench 上也具备竞争力。

编程工具实测

多位开发者在 Cursor、Amp 等编程工具中实测后普遍感到相当惊喜:长任务非常快也很好用,在 Cursor 中的价格约为原先一半。有反馈称,与使用 GPT 5.5、Claude Opus 时不同,Grok 4.5 任务完成太快,需要更频繁回到会话,工作流因此被改变。bytebot 称在 x 账号 $8/月套餐下使用,用量也算合理;tetsuoai 则将其概括为更快、更聪明、而且更便宜。

第 17 集 · 马斯克称 Grok 4.5 部分编程测试胜过 Fable(2026-07-13,3 条)

马斯克表示,Grok 4.5 在部分软件基准上的成绩略高于 Fable,并称后者本身已是“非常好的模型”。他还提到,公众目前接触到的 Mythos/Fable 版本因带 Claude 回退而被明显削弱,引发外界对其真实能力的讨论。

第 18 集 · Grok 4.5登顶代码问答榜并推出联合共建版(2026-07-13,3 条)

最新消息显示,Grok 4.5在SWE-Atlas-QnA基准测试中取得最高分,超越了Claude与GPT的现有版本。同时,SpaceXAI与Cursor联合推出了首个共建的Grok 4.5模型。据悉,该模型编程能力已接近前沿水平,且运行速度大幅提升,引发社区对后续Grok 5发布的持续关注。

第 19 集 · Grok 4.5因速度领先受关注(2026-07-14,2 条)

多条讨论认为,Grok 4.5 的主要竞争力不在全面碾压,而在响应与吞吐明显更快。帖文称其吞吐约 80–112 TPS,领先 GPT-5.5 Sol 和 Claude Fable 5,使用户能更频繁微调输出、维持工作流中的“心流”状态。

第 20 集 · Grok 4.5 聚焦编程与代理工作流(2026-07-15,12 条)

xAI 发布 Grok 4.5 后,讨论焦点明显落在编程与代理式工作,而不是通用聊天能力升级。现有帖子普遍把它描述为面向真实工程任务的新模型,外界关注点也随之转向:它能否真正进入开发者的日常工作流。结合帖文来看,欧洲上线、免费试用与接入 Cursor,是这次发布最受关注的几个落点。

定位与能力

多条转述称,Grok 4.5 是 xAI 首个专门为 coding 和 agents 训练的模型,主打大型代码库处理、跨多个仓库执行长时间任务,以及对数百种 skills、各类工具和 MCP 的适配。tetsuoai 等帖文还反复强调,它的卖点是速度、效率和持续 agentic work,相关转述也将其概括为更快、更低成本、在编码场景更强。

XFreeze 转述马斯克称,Grok 4.5 的早期 beta 先提供给 Tesla 和 SpaceX 工程师使用,再根据他们解决实际工程问题时给出的反馈持续迭代。因此这次发布强调的是“真实世界可用性”,而不只是基准成绩。

上线与接入

tetsuoai 与 markk 的帖子显示,Grok 4.5 已在欧洲上线,用户可在 Grok Build 中通过 /model 进行切换。markk 随后又称,该模型已经可以在 Cursor 中使用,且欧洲地区同样可用。另有转述称,Grok 4.5 已开放免费试用。

现阶段信息边界

从这组材料看,关于性能领先、接近“Opus 级”以及编码榜单表现等说法,主要仍来自发布期的官方口径、转述与早期体验反馈。独立、系统的外部评测信息还比较有限,因此它最终能否站稳开发者工具链,仍有待后续验证。