专题 · FULL STORY

GPT-5.6与Grok 4.5:前沿模型一周内密集发布

从传闻多版本曝光到双双正式发布,OpenAI与xAI在一周内相继推出GPT-5.6系列与Grok 4.5。两者均主打编码能力与极致性价比,发布后迅速引发大量实测与横向对比。

2026-07-03 ~ 2026-07-11 · 20 集 · 469 条

第 1 集 · GPT-5.6多版本曝光,传闻最快7月7日发布(2026-07-03,8 条)

近期,关于OpenAI即将发布下一代模型GPT-5.6的传闻密集出现,引发AI社区高度关注。预测市场Polymarket显示,GPT-5.6在7月7日前发布的概率一度达到75%,多名爆料人也指出了相近的时间节点,但相关消息目前均未获OpenAI官方证实。

关键细节与产品线

据@haider1泄露及@altryne在AI Engineer World's Fair上的分享,GPT-5.6系列预计将包含Sol、Terra和Luna三个版本,并配有超高性能的Ultra模式。其中,Luna性能对标Codex 5.3 / GPT-5.4,但成本仅为其零头,有望成为约80%任务的默认模型;Terra则负责更复杂的工作。此外,@dl_weekly指出OpenAI已将该系列作为“最强网络安全模型”启动有限预览,配备了分层防护栈,并投入了70万GPU小时的自动化红队测试。

发布迹象与各方传闻

在官方公告前,已有代码层面的迹象浮出水面。@haider1发现,GPT-5.6的多个变体上周已被加入Codex内的Amazon Bedrock服务目录且相关PR已合并。爆料人“Leo”及@synthwavedd等均透露发布窗口在7月,最快可能于7日落地。此外,还有传闻称同日Anthropic将移除Claude订阅用户的Fable 5访问权限,进一步加剧了市场对竞品同步更新的猜测。

第 2 集 · GPT 5.6 属 Opus 级,比 Opus 4.8 更便宜更快(2026-07-04,3 条)

第 3 集 · 传闻OpenAI即将发布GPT-5.6系列多版本模型(2026-07-05,17 条)

近期社群中大量流传OpenAI即将发布GPT-5.6系列模型的消息。据多位博主和爆料者透露,OpenAI在休假结束后,预计于7月7日或8日左右正式推出新一代模型。目前这些信息均来自第三方传闻或内部消息人士,OpenAI官方尚未予以证实。

关键模型版本与细节

据爆料,GPT-5.6将延续多层级模型策略,包含Sol、Terra、Luna等多个版本。其中,Sol档位(特别是Sol Ultra模式)备受关注。据称Sol Ultra将包含子agent,专门面向长程agentic任务和复杂编码需求(如Terminal-Bench测试),并确认将登陆Codex。此外,有消息称该系列模型早在6月26日就已向有限合作伙伴提供预览访问。

性能跃升与推理速度突破

在性能方面,消息人士@haider1预测GPT-5.6将实现从5.4到5.5那样的重大性能进步,其底层采用了新的预训练与强化学习技术栈,token效率曲线得到显著改善。在推理速度上,传闻GPT-5.6 Sol将在Cerebras硬件上提供推理服务,速度最高可达每秒750 tokens。@Angaisb_指出,如此高的生成速度将使AI游戏NPC伴侣等功能首次达到真正的实用水平。不过,OpenAI表示Cerebras上运行的是“同一个”模型,但在上下文长度等方面可能存在差异。

竞争环境与基准测试存疑

在发布时机上,有观点认为当前竞争对手Anthropic的Fable 5模型因体验问题引发用户不满,正是OpenAI推出GPT-5.6抢占用户的理想时机。此外,针对GPT-5.6的基准测试表现,@daniel_mac8指出目前仅公开了一项流行行业基准。他推测,这要么是因为新模型全面碾压对手所以留了一手,要么是其在其他基准测试中表现不佳而刻意低调处理。

第 4 集 · 网传GPT-5.6发现新数学,消息未获证实(2026-07-06,2 条)

Reddit 上流传截图称 Sam Altman 暗示 GPT-5.6 正在发现新的数学结论,但截图发布者粉丝量为 0,且 OpenAI 与 Altman 均未公开确认,真实性存疑。若属实,这将是继两个月前模型据称证伪离散几何一项 80 年猜想后的又一数学突破。

第 5 集 · 马斯克官宣Grok 4.5发布,1.5万亿参数强化编码(2026-07-07,25 条)

马斯克于7月8日宣布,基于Beta测试客户的强烈正面反馈,xAI将于次日向公众发布Grok 4.5模型。他宣称该模型达到了Opus级别的性能,但运行速度更快、token效率更高且成本更低。这一官方消息印证了近日网络上铺天盖地的爆料。

关键细节与传闻汇总

在官方确认前,多名爆料者与测试账号已透露大量细节。据@tetsuoai与@XFreeze等整理的信息,Grok 4.5运行在全新的V9基座模型上,参数规模达到1.5万亿,是此前V8-small(0.5万亿)的三倍,也是xAI迄今发布的最大模型。训练重点放在了编码和智能体任务上。此外,@nima_owji与@testingcatalog等发现Grok网页端已出现4.5版本的痕迹,@mark_k则爆料该模型在发布初期将仅限SuperGrok Heavy订阅用户进行早期访问。

深度联手Cursor

多方消息指出xAI此次与编程工具Cursor进行了深度联动。据@kimmonismus与@ns123abc等转述的内部备忘录及媒体报道,双方联合开发了这款大模型,旨在关键领域直接对标Opus 4.8与GPT 5.5。@haider1补充称模型训练了Cursor数据,以提升智能体编程能力。不过@Angaisb_表示,虽然对xAI不抱期待,但看好Cursor的优化能力。

后续模型路线图

在公布Grok 4.5的同时,马斯克(@elonmusk)还透露了后续研发计划。他表示Grok Build harness和1.5T基座模型会根据用户需求持续改进,而参数规模更大的Grok 2T模型将在本月完成训练,预计于下个月向客户提供。

还有 5 条相关讨论 →

第 6 集 · 预测市场高度押注Grok 4.4近期发布(2026-07-07,2 条)

预测市场Polymarket上,关于xAI推出Grok 4.4的押注持续升温:其在7月17日前发布的合约概率一度达94%,月底前发布的合约也达84%。这些数字反映出市场对新版模型近期上线的强烈预期,但仍非官方确认。

第 7 集 · OpenAI 官宣 GPT-5.6 Sol 周四发布,早期实测评价两极(2026-07-07,58 条)

OpenAI 官方及 CEO Sam Altman 宣布,GPT-5.6 Sol 将与 Terra、Luna 一起于本周四正式公开发布,目前正面向全球扩大预览访问范围。在官方确认前,预测市场 Polymarket 曾给出 80% 的发布概率押注,并有爆料称其大规模推出需获得美国政府相关部门的放行批准。

早期测试反馈与能力跃升

多位获得早期访问权限的开发者与研究者指出,GPT-5.6 是一次令人印象深刻的大幅升级。沃顿商学院教授 Ethan Mollick 认为,GPT-5.6 Sol 与 Anthropic 的 Fable 实现了对前代模型的跨越,拉开了巨大差距。开发者 Matt Shumer 也认同从 GPT-5.5 到 5.6 是巨大跨越。在具体应用上,作者 Dan Shipper 称其是首个能“可靠地跑完整个知识工作循环”的模型,尤其在撰写营销邮件等任务上表现稳定。此外,该模型在 Cerebras 专用 AI 芯片上的推理速度可达每秒 750 个 token。

与竞品 Fable 的对比与争议

尽管能力极强,早期测试者在 Sol 与 Fable 的对比中评价各有侧重。Matt Shumer 与开发者 @theo 均表示,在多数任务和整体“智能感”上,Fable 明显更强且更具 agent 能力。Ethan Mollick 总结出两者的使用策略:对于需求不明确、需来回探讨的任务适合用 Sol;对于目标明确的长任务适合用自主性更强的 Fable;而面对极具挑战性的硬核难题,则可切换至 Sol Pro。不过,Dan Shipper 持不同观点,他认为 GPT-5.6 的写作能力明显强于 Fable。

还有 38 条相关讨论 →

第 8 集 · OpenAI 发布全双工语音模型 GPT-Live(2026-07-07,44 条)

7月9日,OpenAI 正式发布并上线了新一代全双工语音模型 GPT-Live,标志着 ChatGPT 语音交互能力迎来重大升级。该模型支持更自然的边听边说与随时打断体验,旨在让人机对话如同真实交流般流畅。

关键细节与版本分配

GPT-Live 的核心突破在于将语音对话与繁重的计算任务分离。当遇到需要搜索或深度推理的复杂问题时,模型会在后台将任务交给前沿模型(发布时为 GPT-5.5)处理,同时保持语音对话不中断。此外,它还能实时生成 UI 界面,以天气、股票、体育等可视卡片的形式展示信息。版本方面,GPT-Live-1 作为 Go、Plus 和 Pro 用户的默认版本,GPT-Live-1 mini 则面向免费用户。OpenAI 还预告将把这两个版本接入 API,并已开放给开发者和企业注册通知。

性能提升与产品演进

据 @testingcatalog 提供的数据,GPT-Live-1 在 GPQA、BrowseComp 以及内部 τ³-Voice Telecom 测试等多个维度上均显著优于之前的 Advanced Voice Mode。该模型最初曾被命名为“GPT Bidi 1”,后正式更名为 GPT Live 1,以统一语音产品线的命名规范。官方在近期的直播演示中还展示了其图像交互等新能力。

还有 24 条相关讨论 →

第 9 集 · Grok 4.5 发布主打编程与低价(2026-07-08,61 条)

xAI 正式发布了 Grok 4.5 模型,主要面向编程与智能体场景。该模型以极具竞争力的低价切入市场,并在发布后迅速登陆各大模型评测榜单与编程工具,引发了社区的广泛关注与积极反馈。

定价与可用渠道

Grok 4.5 的定价为每百万 token 输入 2 美元、输出 6 美元。该模型已确认上线 Grok Build、Cursor 和 SpaceXAI 控制台。在 Cursor 中,其 Fast mode(快速模式)定价为输入 4 美元、输出 18 美元每百万 token。

评测表现与榜单成绩

在 Artificial Analysis 评测中,Grok 4.5 获得 54 分,在 Intelligence Index 排名第四,仅次于部分 Claude、GPT 和 Fable 系列模型。在针对真实知识工作任务的评测中,其平均每个任务成本约 0.49 至 1.12 美元,耗时约 12.4 分钟。马斯克转发称其在部分基准测试中排名第一。此外,在 CritPt 编程评测中,其表现介于 Opus 4.6-7 与 4.8 之间。

实际反馈与性价比优势

多位用户与博主强调了该模型的高性价比。有测试指出其编程能力可与 GPT-5.5-xhigh 相当,但成本仅为一半;在真实任务中的成本比 Opus 4.8 便宜约 17 倍。在 Cursor 的实测反馈中,用户认为它在“构思到实现”的流程中体验优良,整体感觉像一个更快、更便宜的 Opus 4.8。分析认为,这与模型在高质量编码轨迹上训练,并深度融合了 Cursor 数据密切相关。

还有 41 条相关讨论 →

第 10 集 · ChatGPT 新版语音模式实测:多语言表现逼近真人(2026-07-09,14 条)

近期,ChatGPT 的语音模式迎来了一次重大更新。多位用户在升级最新版 App 后进行了实测,普遍认为新版本的语音交互体验有了显著提升,拟真度和流畅度大幅增强,甚至让人产生了“接近 AGI”的科幻感。这一事件标志着 AI 语音交互正在打破传统的一问一答范式,变得更加自然。

多语言与拟真度表现

多位用户反馈新版语音模式在非英语语境下表现极为出色。@asian_tea_man 惊叹于俄语模式下离谱的拟真度,模型会自然地停顿、叹气甚至随机咯咯笑,还会表现出“累了”的情绪;相比之下英文声音略显客服化和公式化。@SteeeeveJune 和 @Bob-the-Human 也分别称赞了德语发音的自然度以及边想边说的停顿质感。@flowersslop 补充说,不同语言下的口音表现会有变化,整体非常顺滑,并特别提到 Maple 这个声音很可爱。

交互体验与情感反馈

新版本在对话中展现出了更强的智能感和情感共鸣。@Healthy-Nebula-3603 提到模型在联网搜索时表现更好,甚至会主动让人安静,结束后自行关闭对话。@flowersslop 连续进行了 40 分钟的情感倾诉对话,体验到了真实的共情与倾听。@Dimillian 和 @RileyRalmuto 均认为这种自然的交互范式正在终结传统的问答模式。

争议与存疑

尽管整体评价极高,但仍有需要注意的边界。@emollick 特别提醒,语音模型并不等于完整的思考模型,使用者仍需留意其能力限制。此外,@Bob-the-Human 指出新版声音音量变低,在嘈杂环境如车内不易听清,且原本可以模拟的法语或德语口音现在可能受到了限制。

第 11 集 · GPT-5.6 实测:自主编码跃升,全面对标 Fable 5(2026-07-09,30 条)

OpenAI 将 GPT-5.6(包括 Sol Ultra 等模式)向公众开放后,迅速在开发者社区引发了大量实测与横向对比。多位深度测试过该模型的用户(如 @MatthewBerman 累计测试超 250 亿 tokens)一致认为,相比 GPT-5.5,新版本在自主性、速度和准确率上实现了巨大飞跃,标志着模型能力的显著跃升。

核心能力与工程交付

GPT-5.6 在长时间持续工作和复杂项目推进上表现惊艳。@rudrank 指出它是首个通过“走开测试”的模型——在无人监督运行数小时甚至数天后,能直接产出可合并的 PR 并完成工程交付动作。@Accomplished_Whole_6 和 @max_paperclips 均提到,它处理以往耗时数小时的任务现在极为迅速,性格也更平和亲和,极大拓展了开发者的项目野心。

与 Fable 5 的正面对决

社区将 GPT-5.6 与 Claude Fable 5 进行了全方位对比。在复杂任务的交叉审查中(@haltakov),GPT-5.6 因架构更清晰、边缘情况处理更安全而胜出;@petergyang 也认为其在前端设计上已追平 Fable。尽管 @TawohAwa 和 @mattshumer_ 指出 Fable 5 在 3D 游戏的玩法手感和创意编码上仍具优势,但 GPT-5.6 展现出了直接竞争力。

性价比与短板争议

在成本控制上 GPT-5.6 优势显著。@GCWebDesigner 引用的 CursorBench 数据显示,GPT-5.6 Sol Max 得分 67.2%,单任务成本 5.22 美元;而 Fable 5 Max 得分 70.5%,单任务成本达 17.32 美元。不过,@tengyanAI 也提醒模型并非完美,在端到端代码修复和诚实性指标上仍存短板。综合而言,@every 等人认为其已足以胜任日常主力模型。

还有 10 条相关讨论 →

第 12 集 · xAI发布Grok 4.5:主打编程与智能体,对标Opus(2026-07-09,55 条)

7月9日,xAI正式发布了Grok 4.5模型。官方将其描述为首个专门针对编程和智能体任务训练的模型,并与Cursor合作进行训练。该模型主要面向真实的工程任务,擅长处理大代码库、跨多个仓库的长任务,以及多技能和多工具的编排。埃隆·马斯克表示,内部评估认为Grok 4.5的能力大致可与Claude Opus 4.7相当,但速度更快、成本更低,能提供单位时间与成本下的最高智能。

核心参数与定价

Grok 4.5支持50万(500K)token的上下文窗口,速度达到80 tokens/s,并支持工具调用、结构化输出和视觉(图像转文本)等功能。API定价方面,输入价格为每百万token 2美元,输出为每百万token 6美元。此外,该模型在输出上极为省token,在SWE Bench Pro测试中,其平均输出token(15,954个)远低于Claude Opus 4.8 max(67,020个),约节省4.2倍。

平台可用性

目前,Grok 4.5已全面上线并开始推送。用户可以通过grok.com聊天端、Grok Build(需更新至0.2.92版本)、Cursor的全部方案、Hermes Agent、OpenClaw以及xAI API和OpenRouter等网关平台体验该模型。不过,欧盟地区预计要到7月中旬才能上线。

还有 35 条相关讨论 →

第 13 集 · Grok 4.5 跑分亮眼但陷测试集泄露争议(2026-07-09,6 条)

Grok 4.5 在 CursorBench 基准测试中取得了亮眼成绩,以 66.7% 的得分排名第三,仅次于 Fable 5 Max 等模型。但该成绩随后因训练数据污染问题陷入争议,引发社区对其实际性能的讨论。

性价比与跑分表现

据 @XFreeze 和 @JOBhakdi 转述的测试结果,Grok 4.5 High 在 CursorBench 上表现优异,得分紧咬 70.5% 的 Fable 5 Max。更引人注目的是其成本优势:单任务成本仅为 1.51 美元。作者指出,这种高性价比主要归功于模型消耗的 token 数量更少。不过 @JOBhakdi 也强调,目前仍需更多基准测试来全面验证其实力。

训练数据污染争议

@AlyoshaV 和 @SkyLi0n 透露,Grok 4.5 在该基准上的优势部分源于“意外”。其训练集中包含了 Cursor 代码库的早期快照,这直接影响了跑分表现。官方回应称,虽然确切分数受到的影响尚不清楚,但相关数据已从未来的模型训练批次中彻底移除,后续模型不会再出现此类问题。

第 14 集 · 社区疯传多款 AI 模型即将密集发布(2026-07-09,2 条)

AI 社区近日流传着一份密集的模型与产品发布清单。传闻名单中不仅包含 OpenAI 的 GPT-5.6、Sol、Terra、Luna,还涉及 Grok 4.5、Composer 2.5 以及 Cognition 的 SWE 系列等。此外,字节跳动的 Seedream 5 Pro 等多款产品也位列其中。这波汇总引发了开发者对 AI 行业即将迎来新一轮密集更新的高度关注。

第 15 集 · Grok 4.5 发布获大量好评:速度快、编码强(2026-07-09,13 条)

近期 Grok 4.5 的发布在 AI 社区引发了广泛关注,大量用户在实测后给出了极高的正面评价。这标志着 Grok 系列模型在能力上实现了显著跨越,不再被视为单纯的边缘产品,而是正式跻身严肃的前沿模型竞争行列。

核心体验与性能反馈

多位用户(如 @tetsuoai、@mark_k、@Star_Knight12)一致认为 Grok 4.5 的表现“出乎意料地好”。在具体应用场景上,@xiaohu 指出它在简单任务、写作和前端任务上体验接近更高水平,且速度极快、API 价格便宜。@Daniel_Farinax 在连续 24 小时高强度使用后,称其执行想法时几乎没有摩擦,体验具有碾压性优势,甚至表示愿意因此取消 Claude Max 订阅改用 Grok Heavy。@chrisfirst 也直观感受到它相比上一代 Grok 4 有了立竿见影的提升。

编码能力与工作流融合

Grok 4.5 在编程方面的表现尤为受认可。@mariofilhoml 专门针对其编码能力给出了“surprisingly good”的评价,社群中也有声音认为其编码能力很能打。此外,@tylerbruno05 赞赏了其 build TUI 的体验,@mark_k 则报告称该模型在 AI 代码编辑器 Cursor 中的实际使用表现非常出色。

横评对比与综合定位

在与其他主流模型的横向对比中,@HarveenChadha 给出了大致排序,认为其实际体验配得上外界的期待,整体水平与 GLM 5.2 接近。@max_paperclips 等用户也感叹,Grok 终于摆脱了以往“玩笑式存在”的标签,成为了一个真正认真且能打的模型。

第 16 集 · Grok 4.5 因处理速度与整体表现获好评(2026-07-09,2 条)

近期社区对 Grok 4.5 模型的实际体验进行了反馈,普遍认为该模型是一个表现优异的产品。用户特别强调了它在处理速度方面极为突出,能够快速响应。此外,在应对大型复杂任务时,Grok 4.5 的整体表现也十分“到位”,展现了良好的综合实力与产品成熟度。

第 17 集 · 编码实测:Grok 4.5速度与上下文消耗均优于Fable(2026-07-09,3 条)

在一项包含创建新分支和后台3D对象功能的编码实测中,Grok 4.5展现出显著优势。它仅用56秒、消耗58K上下文token便生成了有效结果;相比之下,Fable完成相同任务耗时长达10分钟,且消耗了93K token。这表明在特定开发场景下,Grok 4.5的执行效率与资源利用率均大幅领先。

第 18 集 · Grok 4.5发布并登上Vals榜单第六名(2026-07-09,2 条)

Grok 4.5正式发布,并在Vals Index榜单上取得第六名,得分达到65.3%。与上一代Grok模型相比,新版本在基准测试中的得分提升了近20个百分点。这一显著的榜单表现提升被业界视为一个令人印象深刻的进步,展示了该模型在能力上的大幅跨越。

第 19 集 · 前沿模型横评:GPT-5.6 性价比与创造力获好评(2026-07-09,3 条)

近期多位开发者对几款前沿 AI 模型进行了主观横向评测。综合来看,Fable 5 依然被公认为整体表现最佳的模型,而 GPT-5.6 的能力已接近 Opus 4.8 水平。评测指出,GPT-5.6 在前端视觉生成上更具创造力,且在 token 效率和价格上优势明显。尽管整体表现略逊于 Fable 5,但其极高的性价比使其成为更值得购买的选择。

第 20 集 · OpenAI 发布 GPT-5.6 系列:主打多智能体与极致性价比(2026-07-09,119 条)

7月10日,OpenAI 正式发布 GPT-5.6 系列模型,包含 Sol、Terra 和 Luna 三个子型号,并已在 ChatGPT、Codex 和 API 中全球分批推送。此次更新的核心在于以更低的成本提供更强的综合智能,并引入了多智能体协同等前沿能力,标志着模型在自主执行复杂任务上的重要升级。

模型版本与定位

GPT-5.6 分为三档:Sol 是旗舰模型,面向长周期编码、知识工作、网络安全和科学等复杂任务;Terra 兼顾性能与成本,在更低价格下达到接近 GPT-5.5 的表现;Luna 则是最快、最便宜的版本,专为高吞吐和明确任务设计。据 @gdb 透露,GPT-5.6 Luna 在最高推理设置下的表现甚至超过了 GPT-5.5。此外,官方还推出了 Ultra Mode,通过协调多智能体并行工作来处理最复杂的高难度任务。

开发者工具与 API 更新

在 Responses API 中,GPT-5.6 引入了 Programmatic Tool Calling,允许模型直接编写并运行 JavaScript 来编排复杂的工具流程,运行环境为隔离的托管 V8。多智能体能力目前以 Beta 形式提供,支持单次请求并发生成多个子智能体来探索不同方案。同时,API 更新了显式 prompt caching 机制,提供更清晰的缓存边界。

安全控制与实测反馈

由于 GPT-5.6 在网络安全和生物相关任务上能力增强,OpenAI 强化了双用途安全控制,部分 API 调用可能会因安全系统复核而被阻断或暂停。在实测方面,@kimmonismus 指出 GPT-5.6 在编码、浏览和长上下文等多项评测中达到或接近新 SOTA。@Fireship 也发布了首测解读,探讨了该模型在基准测试上的实际表现。

还有 99 条相关讨论 →