专题 · FULL STORY

七月前沿模型潮:GPT-5.6与Grok 4.5发布实测

七月AI圈迎来前沿模型密集发布。OpenAI与xAI相继推出GPT-5.6系列和Grok 4.5。新模型在编码、语音交互及性价比上实现跃升,引发开发者实测与广泛好评。

2026-07-03 ~ 2026-07-11 · 20 集 · 469 条

第 1 集 · Polymarket押注GPT-5.6将在7月7日前发布(2026-07-03,8 条)

第 2 集 · GPT 5.6 属 Opus 级,比 Opus 4.8 更便宜更快(2026-07-04,3 条)

第 3 集 · OpenAI GPT-5.6发布传闻集中升温(2026-07-05,17 条)

多则第三方爆料称OpenAI或于7月7日或9日前后推出GPT-5.6,并可能同步带来实时语音控制、Codex接入及Sol、Terra、Luna等版本;另有帖子称相关型号已现身但仅公开单一行业基准。传闻还提到性能与token效率提升及Cerebras高吞吐,但均未获官方确认。

第 4 集 · 网传GPT-5.6发现新数学,消息未获证实(2026-07-06,2 条)

Reddit 上流传截图称 Sam Altman 暗示 GPT-5.6 正在发现新的数学结论,但截图发布者粉丝量为 0,且 OpenAI 与 Altman 均未公开确认,真实性存疑。若属实,这将是继两个月前模型据称证伪离散几何一项 80 年猜想后的又一数学突破。

第 5 集 · 马斯克宣布Grok 4.5发布,参数达1.5万亿(2026-07-07,25 条)

马斯克宣布基于良好的测试反馈,xAI正式向公众发布Grok 4.5模型。据爆料,该模型采用全新V9基座,参数规模达1.5万亿,并疑似与编程工具Cursor联动。官方宣称其性能对标Opus级别,但速度更快、成本更低。此外,马斯克透露2T参数模型将于本月完成训练并下月交付。

还有 5 条相关讨论 →

第 6 集 · 预测市场高度押注Grok 4.4近期发布(2026-07-07,2 条)

预测市场Polymarket上,关于xAI推出Grok 4.4的押注持续升温:其在7月17日前发布的合约概率一度达94%,月底前发布的合约也达84%。这些数字反映出市场对新版模型近期上线的强烈预期,但仍非官方确认。

第 7 集 · OpenAI官宣GPT-5.6 Sol周四发布,早期反馈能力大幅跃升(2026-07-07,58 条)

OpenAI CEO Sam Altman及官方账号宣布,GPT-5.6 Sol将于本周四公开发布,目前正扩大预览范围。预测市场Polymarket给出其本周发布的概率达80%,并传闻已获美国批准大规模推出。早期测试者反馈称,Sol是一次大幅跃升,比前代更主动且前端能力更强,整体表现与Fable相当但风格迥异,尽管在多数任务上Fable仍略胜一筹。

还有 38 条相关讨论 →

第 8 集 · OpenAI发布新一代语音模型GPT-Live(2026-07-07,44 条)

OpenAI正式发布新一代语音模型GPT-Live,并已在ChatGPT中上线。官方称其为最智能的语音模型,主打更自然的对话体验和更强的时间感知能力。该模型采用全双工架构,将对话与繁重计算分离,在后台将深度推理任务交给GPT-5.5处理,从而保持语音交互不中断。

还有 24 条相关讨论 →

第 9 集 · Grok 4.5 发布主打低成本与高编码性能(2026-07-08,61 条)

xAI 近期发布的 Grok 4.5 模型在社区引发热议。该模型主打低成本与强编码能力,每百万输入 token 定价仅 2 美元,成本远低于 Opus 等竞品。据评测,其在 GDPval-AA v2 等基准测试中排名前列,成为表现最好的非 Anthropic 模型。马斯克也转发了相关评测。支持者认为其极具竞争力的价格和出色的智能体任务表现将推动其广泛采用。

还有 41 条相关讨论 →

第 10 集 · ChatGPT 新版语音模式实测:多语言表现逼近真人(2026-07-09,14 条)

近期,ChatGPT 的语音模式迎来了一次重大更新。多位用户在升级最新版 App 后进行了实测,普遍认为新版本的语音交互体验有了显著提升,拟真度和流畅度大幅增强,甚至让人产生了“接近 AGI”的科幻感。这一事件标志着 AI 语音交互正在打破传统的一问一答范式,变得更加自然。

多语言与拟真度表现

多位用户反馈新版语音模式在非英语语境下表现极为出色。@asian_tea_man 惊叹于俄语模式下离谱的拟真度,模型会自然地停顿、叹气甚至随机咯咯笑,还会表现出“累了”的情绪;相比之下英文声音略显客服化和公式化。@SteeeeveJune 和 @Bob-the-Human 也分别称赞了德语发音的自然度以及边想边说的停顿质感。@flowersslop 补充说,不同语言下的口音表现会有变化,整体非常顺滑,并特别提到 Maple 这个声音很可爱。

交互体验与情感反馈

新版本在对话中展现出了更强的智能感和情感共鸣。@Healthy-Nebula-3603 提到模型在联网搜索时表现更好,甚至会主动让人安静,结束后自行关闭对话。@flowersslop 连续进行了 40 分钟的情感倾诉对话,体验到了真实的共情与倾听。@Dimillian 和 @RileyRalmuto 均认为这种自然的交互范式正在终结传统的问答模式。

争议与存疑

尽管整体评价极高,但仍有需要注意的边界。@emollick 特别提醒,语音模型并不等于完整的思考模型,使用者仍需留意其能力限制。此外,@Bob-the-Human 指出新版声音音量变低,在嘈杂环境如车内不易听清,且原本可以模拟的法语或德语口音现在可能受到了限制。

第 11 集 · GPT-5.6 实测:自主编码跃升,全面对标 Fable 5(2026-07-09,30 条)

OpenAI 将 GPT-5.6(包括 Sol Ultra 等模式)向公众开放后,迅速在开发者社区引发了大量实测与横向对比。多位深度测试过该模型的用户(如 @MatthewBerman 累计测试超 250 亿 tokens)一致认为,相比 GPT-5.5,新版本在自主性、速度和准确率上实现了巨大飞跃,标志着模型能力的显著跃升。

核心能力与工程交付

GPT-5.6 在长时间持续工作和复杂项目推进上表现惊艳。@rudrank 指出它是首个通过“走开测试”的模型——在无人监督运行数小时甚至数天后,能直接产出可合并的 PR 并完成工程交付动作。@Accomplished_Whole_6 和 @max_paperclips 均提到,它处理以往耗时数小时的任务现在极为迅速,性格也更平和亲和,极大拓展了开发者的项目野心。

与 Fable 5 的正面对决

社区将 GPT-5.6 与 Claude Fable 5 进行了全方位对比。在复杂任务的交叉审查中(@haltakov),GPT-5.6 因架构更清晰、边缘情况处理更安全而胜出;@petergyang 也认为其在前端设计上已追平 Fable。尽管 @TawohAwa 和 @mattshumer_ 指出 Fable 5 在 3D 游戏的玩法手感和创意编码上仍具优势,但 GPT-5.6 展现出了直接竞争力。

性价比与短板争议

在成本控制上 GPT-5.6 优势显著。@GCWebDesigner 引用的 CursorBench 数据显示,GPT-5.6 Sol Max 得分 67.2%,单任务成本 5.22 美元;而 Fable 5 Max 得分 70.5%,单任务成本达 17.32 美元。不过,@tengyanAI 也提醒模型并非完美,在端到端代码修复和诚实性指标上仍存短板。综合而言,@every 等人认为其已足以胜任日常主力模型。

还有 10 条相关讨论 →

第 12 集 · xAI发布Grok 4.5主打编程与智能体(2026-07-09,55 条)

xAI正式发布Grok 4.5模型,这是首个专为编码和智能体训练的模型,并与Cursor合作。该模型主打真实工程任务,擅长大代码库、跨仓库长任务及多工具调用,能端到端交付完整PR堆栈。马斯克表示其能力可与Opus 4.7相当,但速度更快、成本更低。

还有 35 条相关讨论 →

第 13 集 · Grok 4.5 跑分受 Cursor 代码库泄露影响(2026-07-09,6 条)

最新 CursorBench 评测显示,Grok 4.5 以 66.7% 的得分排名第三,紧随 Fable 5 Max 之后,且单任务成本明显更低。然而,官方注释透露其基准优势部分源于训练数据意外混入了 Cursor 代码库的早期快照。目前该批次数据已被移除,以确保未来模型训练的公正性,确切分数影响尚在评估中。

第 14 集 · 社区疯传多款 AI 模型即将密集发布(2026-07-09,2 条)

AI 社区近日流传着一份密集的模型与产品发布清单。传闻名单中不仅包含 OpenAI 的 GPT-5.6、Sol、Terra、Luna,还涉及 Grok 4.5、Composer 2.5 以及 Cognition 的 SWE 系列等。此外,字节跳动的 Seedream 5 Pro 等多款产品也位列其中。这波汇总引发了开发者对 AI 行业即将迎来新一轮密集更新的高度关注。

第 15 集 · Grok 4.5 发布获大量好评:速度快、编码强(2026-07-09,13 条)

近期 Grok 4.5 的发布在 AI 社区引发了广泛关注,大量用户在实测后给出了极高的正面评价。这标志着 Grok 系列模型在能力上实现了显著跨越,不再被视为单纯的边缘产品,而是正式跻身严肃的前沿模型竞争行列。

核心体验与性能反馈

多位用户(如 @tetsuoai、@mark_k、@Star_Knight12)一致认为 Grok 4.5 的表现“出乎意料地好”。在具体应用场景上,@xiaohu 指出它在简单任务、写作和前端任务上体验接近更高水平,且速度极快、API 价格便宜。@Daniel_Farinax 在连续 24 小时高强度使用后,称其执行想法时几乎没有摩擦,体验具有碾压性优势,甚至表示愿意因此取消 Claude Max 订阅改用 Grok Heavy。@chrisfirst 也直观感受到它相比上一代 Grok 4 有了立竿见影的提升。

编码能力与工作流融合

Grok 4.5 在编程方面的表现尤为受认可。@mariofilhoml 专门针对其编码能力给出了“surprisingly good”的评价,社群中也有声音认为其编码能力很能打。此外,@tylerbruno05 赞赏了其 build TUI 的体验,@mark_k 则报告称该模型在 AI 代码编辑器 Cursor 中的实际使用表现非常出色。

横评对比与综合定位

在与其他主流模型的横向对比中,@HarveenChadha 给出了大致排序,认为其实际体验配得上外界的期待,整体水平与 GLM 5.2 接近。@max_paperclips 等用户也感叹,Grok 终于摆脱了以往“玩笑式存在”的标签,成为了一个真正认真且能打的模型。

第 16 集 · Grok 4.5 因处理速度与整体表现获好评(2026-07-09,2 条)

近期社区对 Grok 4.5 模型的实际体验进行了反馈,普遍认为该模型是一个表现优异的产品。用户特别强调了它在处理速度方面极为突出,能够快速响应。此外,在应对大型复杂任务时,Grok 4.5 的整体表现也十分“到位”,展现了良好的综合实力与产品成熟度。

第 17 集 · 编码实测:Grok 4.5速度与上下文消耗均优于Fable(2026-07-09,3 条)

在一项包含创建新分支和后台3D对象功能的编码实测中,Grok 4.5展现出显著优势。它仅用56秒、消耗58K上下文token便生成了有效结果;相比之下,Fable完成相同任务耗时长达10分钟,且消耗了93K token。这表明在特定开发场景下,Grok 4.5的执行效率与资源利用率均大幅领先。

第 18 集 · Grok 4.5发布并登上Vals榜单第六名(2026-07-09,2 条)

Grok 4.5正式发布,并在Vals Index榜单上取得第六名,得分达到65.3%。与上一代Grok模型相比,新版本在基准测试中的得分提升了近20个百分点。这一显著的榜单表现提升被业界视为一个令人印象深刻的进步,展示了该模型在能力上的大幅跨越。

第 19 集 · 前沿模型横评:GPT-5.6 性价比与创造力获好评(2026-07-09,3 条)

近期多位开发者对几款前沿 AI 模型进行了主观横向评测。综合来看,Fable 5 依然被公认为整体表现最佳的模型,而 GPT-5.6 的能力已接近 Opus 4.8 水平。评测指出,GPT-5.6 在前端视觉生成上更具创造力,且在 token 效率和价格上优势明显。尽管整体表现略逊于 Fable 5,但其极高的性价比使其成为更值得购买的选择。

第 20 集 · OpenAI 发布 GPT-5.6 系列:主打多智能体与极致性价比(2026-07-09,119 条)

7月10日,OpenAI 正式发布 GPT-5.6 系列模型,包含 Sol、Terra 和 Luna 三个子型号,并已在 ChatGPT、Codex 和 API 中全球分批推送。此次更新的核心在于以更低的成本提供更强的综合智能,并引入了多智能体协同等前沿能力,标志着模型在自主执行复杂任务上的重要升级。

模型版本与定位

GPT-5.6 分为三档:Sol 是旗舰模型,面向长周期编码、知识工作、网络安全和科学等复杂任务;Terra 兼顾性能与成本,在更低价格下达到接近 GPT-5.5 的表现;Luna 则是最快、最便宜的版本,专为高吞吐和明确任务设计。据 @gdb 透露,GPT-5.6 Luna 在最高推理设置下的表现甚至超过了 GPT-5.5。此外,官方还推出了 Ultra Mode,通过协调多智能体并行工作来处理最复杂的高难度任务。

开发者工具与 API 更新

在 Responses API 中,GPT-5.6 引入了 Programmatic Tool Calling,允许模型直接编写并运行 JavaScript 来编排复杂的工具流程,运行环境为隔离的托管 V8。多智能体能力目前以 Beta 形式提供,支持单次请求并发生成多个子智能体来探索不同方案。同时,API 更新了显式 prompt caching 机制,提供更清晰的缓存边界。

安全控制与实测反馈

由于 GPT-5.6 在网络安全和生物相关任务上能力增强,OpenAI 强化了双用途安全控制,部分 API 调用可能会因安全系统复核而被阻断或暂停。在实测方面,@kimmonismus 指出 GPT-5.6 在编码、浏览和长上下文等多项评测中达到或接近新 SOTA。@Fireship 也发布了首测解读,探讨了该模型在基准测试上的实际表现。

还有 99 条相关讨论 →