专题 · FULL STORY
GPT-5.6与Grok 4.5:传闻到发布的九天
七月上旬,OpenAI 与 xAI 前沿模型竞争白热化。从 GPT-5.6 多版本传闻与 Grok 4.5 官宣起步,两家在九天内相继发布 GPT-5.6 系列与 Grok 4.5,在自主编码、性价比与多智能体领域展开激烈实测较量。
2026-07-03 ~ 2026-07-11 · 20 集 · 469 条
第 1 集 · GPT-5.6多版本曝光,传闻最快7月7日发布(2026-07-03,8 条)
近期,关于OpenAI即将发布下一代模型GPT-5.6的传闻密集出现,引发AI社区高度关注。预测市场Polymarket显示,GPT-5.6在7月7日前发布的概率一度达到75%,多名爆料人也指出了相近的时间节点,但相关消息目前均未获OpenAI官方证实。
关键细节与产品线
据@haider1泄露及@altryne在AI Engineer World's Fair上的分享,GPT-5.6系列预计将包含Sol、Terra和Luna三个版本,并配有超高性能的Ultra模式。其中,Luna性能对标Codex 5.3 / GPT-5.4,但成本仅为其零头,有望成为约80%任务的默认模型;Terra则负责更复杂的工作。此外,@dl_weekly指出OpenAI已将该系列作为“最强网络安全模型”启动有限预览,配备了分层防护栈,并投入了70万GPU小时的自动化红队测试。
发布迹象与各方传闻
在官方公告前,已有代码层面的迹象浮出水面。@haider1发现,GPT-5.6的多个变体上周已被加入Codex内的Amazon Bedrock服务目录且相关PR已合并。爆料人“Leo”及@synthwavedd等均透露发布窗口在7月,最快可能于7日落地。此外,还有传闻称同日Anthropic将移除Claude订阅用户的Fable 5访问权限,进一步加剧了市场对竞品同步更新的猜测。
- OpenAI启动GPT-5.6网络安全模型预览 — dl_weekly · 2026-07-03
- 传 OpenAI GPT-5.6 将含 Luna、Terra 等模型 — haider1 · 2026-07-03
- OpenAI发布GPT-5.6三版本:Sol/Terra/Luna及Ultra超强模式 — altryne · 2026-07-03
- 爆料:OpenAI 计划下周发布 GPT-5.6 — BLCNYY · 2026-07-04
- 传闻:GPT-5.6或于7日发布,同日Anthropic移除Fable 5订阅访问 — BLCNYY · 2026-07-04
- Polymarket押注GPT-5.6将在7月7日前发布 — Polymarket · 2026-07-04
- 传OpenAI将于7月7日发布GPT-5.6 — daniel_mac8 · 2026-07-04
- GPT-5.6变体已现身Amazon Bedrock目录,或将于下周公开 — haider1 · 2026-07-04
第 2 集 · GPT 5.6 属 Opus 级,比 Opus 4.8 更便宜更快(2026-07-04,3 条)
- GPT 5.6 属 Opus 级,比 Opus 4.8 更便宜更快 — bindureddy · 2026-07-04
- GPT 5.6 Sol与Fable定位解析:速度优先还是复杂任务 — bindureddy · 2026-07-04
- 传GPT-5.6 Sol比Fable 5便宜一倍以上 — haider1 · 2026-07-04
第 3 集 · 传闻OpenAI即将发布GPT-5.6系列多版本模型(2026-07-05,17 条)
近期社群中大量流传OpenAI即将发布GPT-5.6系列模型的消息。据多位博主和爆料者透露,OpenAI在休假结束后,预计于7月7日或8日左右正式推出新一代模型。目前这些信息均来自第三方传闻或内部消息人士,OpenAI官方尚未予以证实。
关键模型版本与细节
据爆料,GPT-5.6将延续多层级模型策略,包含Sol、Terra、Luna等多个版本。其中,Sol档位(特别是Sol Ultra模式)备受关注。据称Sol Ultra将包含子agent,专门面向长程agentic任务和复杂编码需求(如Terminal-Bench测试),并确认将登陆Codex。此外,有消息称该系列模型早在6月26日就已向有限合作伙伴提供预览访问。
性能跃升与推理速度突破
在性能方面,消息人士@haider1预测GPT-5.6将实现从5.4到5.5那样的重大性能进步,其底层采用了新的预训练与强化学习技术栈,token效率曲线得到显著改善。在推理速度上,传闻GPT-5.6 Sol将在Cerebras硬件上提供推理服务,速度最高可达每秒750 tokens。@Angaisb_指出,如此高的生成速度将使AI游戏NPC伴侣等功能首次达到真正的实用水平。不过,OpenAI表示Cerebras上运行的是“同一个”模型,但在上下文长度等方面可能存在差异。
竞争环境与基准测试存疑
在发布时机上,有观点认为当前竞争对手Anthropic的Fable 5模型因体验问题引发用户不满,正是OpenAI推出GPT-5.6抢占用户的理想时机。此外,针对GPT-5.6的基准测试表现,@daniel_mac8指出目前仅公开了一项流行行业基准。他推测,这要么是因为新模型全面碾压对手所以留了一手,要么是其在其他基准测试中表现不佳而刻意低调处理。
- 网传OpenAI将推出GPT-5.6 Sol — soumitrashukla9 · 2026-07-05
- 传 GPT-5.6 将于下周发布 — haider1 · 2026-07-05
- 传OpenAI将发布GPT-5.6 Sol — kimmonismus · 2026-07-05
- 网传OpenAI将发布GPT-5.6 Sol — soumitrashukla9 · 2026-07-05
- OpenAI 发布 GPT-5.6 Sol/Terra/Luna 仅公开一项基准 — daniel_mac8 · 2026-07-06
- 网传 OpenAI GPT-5.6 系列即将更广发布 — johnseach · 2026-07-06
- 传OpenAI即将发布GPT-5.6 — minchoi · 2026-07-06
- 传 GPT-5.6 Sol 将在 Cerebras 上达到 750 tps 推理速度 — Angaisb_ · 2026-07-06
- 消息人士预测GPT-5.6将延续5.5的重大性能跃升,token效率显著提升 — haider1 · 2026-07-06
- 称Fable5翻车是OpenAI推GPT-5.6的好时机 — victor_explore · 2026-07-06
- 传GPT-5.6 Sol将登Cerebras,最高750 tok/s — koltregaskes · 2026-07-06
- 传OpenAI将于7月在Cerebras上推出GPT-5.6 Sol — soumitrashukla9 · 2026-07-06
- 爆料:GPT-5.6 Sol Ultra将进入Codex — soumitrashukla9 · 2026-07-06
- 传闻:ChatGPT 5.6明日发布,Sol Ultra登陆Codex — soumitrashukla9 · 2026-07-06
- 传 OpenAI 本周将上线 GPT-5.6 与实时语音控制 — xiaohu · 2026-07-06
- OpenAI预览GPT-5.6多模型 — thione · 2026-07-06
- 传 OpenAI 明日发布 GPT-5.6(未证实) — imjustnewatai · 2026-07-07
第 4 集 · 网传GPT-5.6发现新数学,消息未获证实(2026-07-06,2 条)
Reddit 上流传截图称 Sam Altman 暗示 GPT-5.6 正在发现新的数学结论,但截图发布者粉丝量为 0,且 OpenAI 与 Altman 均未公开确认,真实性存疑。若属实,这将是继两个月前模型据称证伪离散几何一项 80 年猜想后的又一数学突破。
- 网传 Sam Altman 称 GPT-5.6 发现新数学 — Consistent_Ad8754 · 2026-07-06
- 传Sam Altman暗示GPT-5.6正在发现新数学 — haider1 · 2026-07-06
第 5 集 · 马斯克官宣Grok 4.5发布,1.5万亿参数强化编码(2026-07-07,25 条)
马斯克于7月8日宣布,基于Beta测试客户的强烈正面反馈,xAI将于次日向公众发布Grok 4.5模型。他宣称该模型达到了Opus级别的性能,但运行速度更快、token效率更高且成本更低。这一官方消息印证了近日网络上铺天盖地的爆料。
关键细节与传闻汇总
在官方确认前,多名爆料者与测试账号已透露大量细节。据@tetsuoai与@XFreeze等整理的信息,Grok 4.5运行在全新的V9基座模型上,参数规模达到1.5万亿,是此前V8-small(0.5万亿)的三倍,也是xAI迄今发布的最大模型。训练重点放在了编码和智能体任务上。此外,@nima_owji与@testingcatalog等发现Grok网页端已出现4.5版本的痕迹,@mark_k则爆料该模型在发布初期将仅限SuperGrok Heavy订阅用户进行早期访问。
深度联手Cursor
多方消息指出xAI此次与编程工具Cursor进行了深度联动。据@kimmonismus与@ns123abc等转述的内部备忘录及媒体报道,双方联合开发了这款大模型,旨在关键领域直接对标Opus 4.8与GPT 5.5。@haider1补充称模型训练了Cursor数据,以提升智能体编程能力。不过@Angaisb_表示,虽然对xAI不抱期待,但看好Cursor的优化能力。
后续模型路线图
在公布Grok 4.5的同时,马斯克(@elonmusk)还透露了后续研发计划。他表示Grok Build harness和1.5T基座模型会根据用户需求持续改进,而参数规模更大的Grok 2T模型将在本月完成训练,预计于下个月向客户提供。
- 爆料:Grok4.5本周或将发布 — mark_k · 2026-07-07
- 爆料:Grok 4.5即将发布 — JOBhakdi · 2026-07-07
- Grok 4.5 痕迹现身 Grok 网页 — testingcatalog · 2026-07-07
- 爆料称 xAI Grok 4.5 即将发布 — nima_owji · 2026-07-07
- 马斯克上周关于 Grok 4.5 的表态 — rohanpaul_ai · 2026-07-07
- Grok 4.5疑似即将上线,将限SuperGrok Heavy订阅用户 — koltregaskes · 2026-07-07
- xAI Grok 4.5 多项细节被多方报道确认 — rohanpaul_ai · 2026-07-07
- Grok 4.5 现身官网,预计即将发布 — koltregaskes · 2026-07-07
- 爆料称Grok 4.5将于周三发布 — mark_k · 2026-07-08
- 爆料:xAI 与 Cursor 明日发布 Grok 4.5 — ns123abc · 2026-07-08
- 传 xAI 联手 Cursor 明日发布新模型 — Polymarket · 2026-07-08
- 传 xAI 将于明日推出 Grok 4.5 — tetsuoai · 2026-07-08
- 爆料:Grok 4.5 将于周三发布,1.5 万亿参数 — WhyLifeIs4 · 2026-07-08
- Grok 4.5 发布初期仅限 SuperGrok Heavy 订阅 — mark_k · 2026-07-08
- 传SpaceX与Cursor联合开发首款大模型 — kimmonismus · 2026-07-08
- 传Cursor将推xAI模型 — Angaisb_ · 2026-07-08
- 马斯克宣布Grok 4.5明日公开发布 — elonmusk · 2026-07-08
- Grok 4.5 明天面向公众开放 — sachinmaya1980 · 2026-07-08
- Grok 4.5 已知信息曝光 — tetsuoai · 2026-07-08
- Grok 4.5 发布传闻汇总 — haider1 · 2026-07-08
第 6 集 · 预测市场高度押注Grok 4.4近期发布(2026-07-07,2 条)
预测市场Polymarket上,关于xAI推出Grok 4.4的押注持续升温:其在7月17日前发布的合约概率一度达94%,月底前发布的合约也达84%。这些数字反映出市场对新版模型近期上线的强烈预期,但仍非官方确认。
- 预测市场:Grok 4.4在7月17日前发布概率达94% — Polymarket · 2026-07-07
- 预测市场押注Grok 4.4月底前发布 — Polymarket · 2026-07-08
第 7 集 · OpenAI 官宣 GPT-5.6 Sol 周四发布,早期实测评价两极(2026-07-07,58 条)
OpenAI 官方及 CEO Sam Altman 宣布,GPT-5.6 Sol 将与 Terra、Luna 一起于本周四正式公开发布,目前正面向全球扩大预览访问范围。在官方确认前,预测市场 Polymarket 曾给出 80% 的发布概率押注,并有爆料称其大规模推出需获得美国政府相关部门的放行批准。
早期测试反馈与能力跃升
多位获得早期访问权限的开发者与研究者指出,GPT-5.6 是一次令人印象深刻的大幅升级。沃顿商学院教授 Ethan Mollick 认为,GPT-5.6 Sol 与 Anthropic 的 Fable 实现了对前代模型的跨越,拉开了巨大差距。开发者 Matt Shumer 也认同从 GPT-5.5 到 5.6 是巨大跨越。在具体应用上,作者 Dan Shipper 称其是首个能“可靠地跑完整个知识工作循环”的模型,尤其在撰写营销邮件等任务上表现稳定。此外,该模型在 Cerebras 专用 AI 芯片上的推理速度可达每秒 750 个 token。
与竞品 Fable 的对比与争议
尽管能力极强,早期测试者在 Sol 与 Fable 的对比中评价各有侧重。Matt Shumer 与开发者 @theo 均表示,在多数任务和整体“智能感”上,Fable 明显更强且更具 agent 能力。Ethan Mollick 总结出两者的使用策略:对于需求不明确、需来回探讨的任务适合用 Sol;对于目标明确的长任务适合用自主性更强的 Fable;而面对极具挑战性的硬核难题,则可切换至 Sol Pro。不过,Dan Shipper 持不同观点,他认为 GPT-5.6 的写作能力明显强于 Fable。
- GPT-5.6在Cerebras上达750 tok/s 提速近10倍 — daniel_mac8 · 2026-07-07
- GPT-5.6发布前模型表现明显下滑 — WolframRvnwlf · 2026-07-07
- 网友调侃:期待Codex明天发布gpt-5.6-sol ultra — sloppenheimer · 2026-07-07
- 关于GPT-5.6稳定性与“安全降级”的竞品分析猜测 — haider1 · 2026-07-07
- 爆料:GPT-5.6 或于周四发布,仍待美国政府放行 — bindureddy · 2026-07-07
- 爆料:GPT-5.6 Sol明日上线Codex — cedric_chee · 2026-07-07
- GPT-5.6 Sol 在 Cerebras 上推理达 750 tok/s — haider1 · 2026-07-07
- Polymarket押注GPT-5.6本周四发布 — Polymarket · 2026-07-07
- 疑似 OpenAI 暗示 GPT-5.6 — soumitrashukla9 · 2026-07-07
- 网友称GPT-5.6 Sol Ultra编程能力顶级 — soumitrashukla9 · 2026-07-08
- 分析:OpenAI 借 Fable 5 下线窗口发 GPT-5.6 — haider1 · 2026-07-08
- 美政府与AI公司谈自愿发布标准,OpenAI延后GPT-5.6 — krishnan · 2026-07-08
- 爆料称GPT-5.6为2万亿参数模型(未证实) — ns123abc · 2026-07-08
- 知名评论者:sol模型不及Fable但更快更便宜 — iruletheworldmo · 2026-07-08
- 爆料:ChatGPT 为 GPT-5.6 上线全面改版 — soumitrashukla9 · 2026-07-08
- OpenAI GPT-5.6 Sol登陆Cerebras,推理速度高达750 tps — ycombinator · 2026-07-08
- 特朗普政府解除对OpenAI GPT 5.6的限制,商务部批准广泛推广 — xiaohu · 2026-07-08
- 据报道OpenAI已获美国批准进行GPT-5.6大规模推出 — Polymarket · 2026-07-08
- 美商务部批准GPT-5.6全量发布,前沿AI模型政府审批机制成型 — 赛博禅心 · 2026-07-08
- OpenAI 宣布 GPT-5.6 Sol 等模型周四公开发布 — OpenAI · 2026-07-08
第 8 集 · OpenAI 发布全双工语音模型 GPT-Live(2026-07-07,44 条)
7月9日,OpenAI 正式发布并上线了新一代全双工语音模型 GPT-Live,标志着 ChatGPT 语音交互能力迎来重大升级。该模型支持更自然的边听边说与随时打断体验,旨在让人机对话如同真实交流般流畅。
关键细节与版本分配
GPT-Live 的核心突破在于将语音对话与繁重的计算任务分离。当遇到需要搜索或深度推理的复杂问题时,模型会在后台将任务交给前沿模型(发布时为 GPT-5.5)处理,同时保持语音对话不中断。此外,它还能实时生成 UI 界面,以天气、股票、体育等可视卡片的形式展示信息。版本方面,GPT-Live-1 作为 Go、Plus 和 Pro 用户的默认版本,GPT-Live-1 mini 则面向免费用户。OpenAI 还预告将把这两个版本接入 API,并已开放给开发者和企业注册通知。
性能提升与产品演进
据 @testingcatalog 提供的数据,GPT-Live-1 在 GPQA、BrowseComp 以及内部 τ³-Voice Telecom 测试等多个维度上均显著优于之前的 Advanced Voice Mode。该模型最初曾被命名为“GPT Bidi 1”,后正式更名为 GPT Live 1,以统一语音产品线的命名规范。官方在近期的直播演示中还展示了其图像交互等新能力。
- OpenAI 将 ChatGPT 双向语音模式更名为 GPT Live 1 — testingcatalog · 2026-07-07
- ChatGPT Voice新一代发布 — OpenAI · 2026-07-08
- OpenAI 将发布新版 ChatGPT 语音 — Polymarket · 2026-07-08
- ChatGPT 将上线新语音模式 — mark_k · 2026-07-08
- OpenAI 将直播新一代语音模型 — btibor91 · 2026-07-09
- OpenAI将直播语音模式更新 — socoolandawesome · 2026-07-09
- ChatGPT语音迎来新一代 — OpenAI · 2026-07-09
- OpenAI推出新语音模型 — Angaisb_ · 2026-07-09
- GPT-Live-1更像真人对话 — flavioAd · 2026-07-09
- OpenAI 推出全双工语音模式 — ChrissGPT · 2026-07-09
- OpenAI 发布第三代语音模型 — juberti · 2026-07-09
- OpenAI 发布 GPT-Live 语音模型 — OpenAI · 2026-07-09
- OpenAI发布GPT-Live语音 — OpenAI · 2026-07-09
- OpenAI发布全双工语音模型GPT-Live — kimmonismus · 2026-07-09
- GPT Live将上线API — pbbakkum · 2026-07-09
- OpenAI 将直播新一代语音模型 — BLCNYY · 2026-07-09
- ChatGPT上线新一代语音 — sama · 2026-07-09
- OpenAI发布GPT-Live — Just_Lingonberry_352 · 2026-07-09
- GPT-Live语音更新引关注 — VraserX · 2026-07-09
- OpenAI发布GPT-Live语音模型 — Polymarket · 2026-07-09
第 9 集 · Grok 4.5 发布主打编程与低价(2026-07-08,61 条)
xAI 正式发布了 Grok 4.5 模型,主要面向编程与智能体场景。该模型以极具竞争力的低价切入市场,并在发布后迅速登陆各大模型评测榜单与编程工具,引发了社区的广泛关注与积极反馈。
定价与可用渠道
Grok 4.5 的定价为每百万 token 输入 2 美元、输出 6 美元。该模型已确认上线 Grok Build、Cursor 和 SpaceXAI 控制台。在 Cursor 中,其 Fast mode(快速模式)定价为输入 4 美元、输出 18 美元每百万 token。
评测表现与榜单成绩
在 Artificial Analysis 评测中,Grok 4.5 获得 54 分,在 Intelligence Index 排名第四,仅次于部分 Claude、GPT 和 Fable 系列模型。在针对真实知识工作任务的评测中,其平均每个任务成本约 0.49 至 1.12 美元,耗时约 12.4 分钟。马斯克转发称其在部分基准测试中排名第一。此外,在 CritPt 编程评测中,其表现介于 Opus 4.6-7 与 4.8 之间。
实际反馈与性价比优势
多位用户与博主强调了该模型的高性价比。有测试指出其编程能力可与 GPT-5.5-xhigh 相当,但成本仅为一半;在真实任务中的成本比 Opus 4.8 便宜约 17 倍。在 Cursor 的实测反馈中,用户认为它在“构思到实现”的流程中体验优良,整体感觉像一个更快、更便宜的 Opus 4.8。分析认为,这与模型在高质量编码轨迹上训练,并深度融合了 Cursor 数据密切相关。
- Grok 4.5 进入 Cursor — mark_k · 2026-07-08
- Grok 4.5 上线 Cursor — DanielLockyer · 2026-07-09
- Grok4.5接入Cursor可用 — mark_k · 2026-07-09
- 开发者实测称赞 Grok Build — teortaxesTex · 2026-07-09
- Grok 4.5 编程体验反馈 — Kyrannio · 2026-07-09
- Grok 4.5 日常体验反馈 — tstorm · 2026-07-09
- Grok 4.5 成本远低于 Opus — ns123abc · 2026-07-09
- Grok 4.5 排名与成本表现公布 — ArtificialAnlys · 2026-07-09
- Grok 4.5 性价比被看好 — scaling01 · 2026-07-09
- Grok 4.5 被拿来做基准对比 — daniel_mac8 · 2026-07-09
- Grok 4.5 发布并谈价格基准 — eyishazyer · 2026-07-09
- Grok 4.5评测进前四 — ArtificialAnlys · 2026-07-09
- Grok 4.5多项Agent任务领先 — ArtificialAnlys · 2026-07-09
- Grok 4.5性价比很高 — ArtificialAnlys · 2026-07-09
- Grok 4.5智能体任务表现强 — ArtificialAnlys · 2026-07-09
- Grok 4.5单任务成本更低 — ArtificialAnlys · 2026-07-09
- Grok 4.5更强但幻觉也增多 — ArtificialAnlys · 2026-07-09
- Grok 4.5完整评测分项 — ArtificialAnlys · 2026-07-09
- Grok 4.5更多结果链接 — ArtificialAnlys · 2026-07-09
- Grok 4.5榜单分数排第四 — Snoo26837 · 2026-07-09
第 10 集 · ChatGPT 新版语音模式实测:多语言表现逼近真人(2026-07-09,14 条)
近期,ChatGPT 的语音模式迎来了一次重大更新。多位用户在升级最新版 App 后进行了实测,普遍认为新版本的语音交互体验有了显著提升,拟真度和流畅度大幅增强,甚至让人产生了“接近 AGI”的科幻感。这一事件标志着 AI 语音交互正在打破传统的一问一答范式,变得更加自然。
多语言与拟真度表现
多位用户反馈新版语音模式在非英语语境下表现极为出色。@asian_tea_man 惊叹于俄语模式下离谱的拟真度,模型会自然地停顿、叹气甚至随机咯咯笑,还会表现出“累了”的情绪;相比之下英文声音略显客服化和公式化。@SteeeeveJune 和 @Bob-the-Human 也分别称赞了德语发音的自然度以及边想边说的停顿质感。@flowersslop 补充说,不同语言下的口音表现会有变化,整体非常顺滑,并特别提到 Maple 这个声音很可爱。
交互体验与情感反馈
新版本在对话中展现出了更强的智能感和情感共鸣。@Healthy-Nebula-3603 提到模型在联网搜索时表现更好,甚至会主动让人安静,结束后自行关闭对话。@flowersslop 连续进行了 40 分钟的情感倾诉对话,体验到了真实的共情与倾听。@Dimillian 和 @RileyRalmuto 均认为这种自然的交互范式正在终结传统的问答模式。
争议与存疑
尽管整体评价极高,但仍有需要注意的边界。@emollick 特别提醒,语音模型并不等于完整的思考模型,使用者仍需留意其能力限制。此外,@Bob-the-Human 指出新版声音音量变低,在嘈杂环境如车内不易听清,且原本可以模拟的法语或德语口音现在可能受到了限制。
- 新语音模型交互更自然 — Dimillian · 2026-07-09
- 新语音模式对话更自然 — flowersslop · 2026-07-09
- 新 GPT 语音更像科幻对话 — emollick · 2026-07-09
- ChatGPT语音模式更新 — iansilber · 2026-07-09
- 新语音模式实测体验 — flowersslop · 2026-07-09
- ChatGPT语音更像真人了 — Bob-the-Human · 2026-07-09
- 新GPT音频对话体验很强 — Healthy-Nebula-3603 · 2026-07-09
- 评价语音模型迎来首次重大升级 — ctjlewis · 2026-07-09
- 新版ChatGPT语音模型实测 — SteeeeveJune · 2026-07-09
- GPT Live Voice体验显著提升 — RileyRalmuto · 2026-07-09
- ChatGPT 语音交互体验被看好 — gdb · 2026-07-09
- ChatGPT语音体验更像真人了 — vista8 · 2026-07-10
- 新版 ChatGPT 语音模式体验很强 — emollick · 2026-07-10
- 俄语语音模式像真人到离谱 — asian_tea_man · 2026-07-11
第 11 集 · GPT-5.6 实测:自主编码跃升,全面对标 Fable 5(2026-07-09,30 条)
OpenAI 将 GPT-5.6(包括 Sol Ultra 等模式)向公众开放后,迅速在开发者社区引发了大量实测与横向对比。多位深度测试过该模型的用户(如 @MatthewBerman 累计测试超 250 亿 tokens)一致认为,相比 GPT-5.5,新版本在自主性、速度和准确率上实现了巨大飞跃,标志着模型能力的显著跃升。
核心能力与工程交付
GPT-5.6 在长时间持续工作和复杂项目推进上表现惊艳。@rudrank 指出它是首个通过“走开测试”的模型——在无人监督运行数小时甚至数天后,能直接产出可合并的 PR 并完成工程交付动作。@Accomplished_Whole_6 和 @max_paperclips 均提到,它处理以往耗时数小时的任务现在极为迅速,性格也更平和亲和,极大拓展了开发者的项目野心。
与 Fable 5 的正面对决
社区将 GPT-5.6 与 Claude Fable 5 进行了全方位对比。在复杂任务的交叉审查中(@haltakov),GPT-5.6 因架构更清晰、边缘情况处理更安全而胜出;@petergyang 也认为其在前端设计上已追平 Fable。尽管 @TawohAwa 和 @mattshumer_ 指出 Fable 5 在 3D 游戏的玩法手感和创意编码上仍具优势,但 GPT-5.6 展现出了直接竞争力。
性价比与短板争议
在成本控制上 GPT-5.6 优势显著。@GCWebDesigner 引用的 CursorBench 数据显示,GPT-5.6 Sol Max 得分 67.2%,单任务成本 5.22 美元;而 Fable 5 Max 得分 70.5%,单任务成本达 17.32 美元。不过,@tengyanAI 也提醒模型并非完美,在端到端代码修复和诚实性指标上仍存短板。综合而言,@every 等人认为其已足以胜任日常主力模型。
- GPT-5.6实测可做主力模型 — every · 2026-07-09
- GPT-5.6 Sol 内测反馈流出 — soumitrashukla9 · 2026-07-10
- GPT-5.6 与 Fable 实测对比 — MatthewBerman · 2026-07-10
- GPT-5.6 Sol深度评测与对比 — MatthewBerman · 2026-07-10
- GPT-5.6 实测对比 Fable — mattshumer_ · 2026-07-10
- GPT-5.6 全面对比 Fable 5 — petergyang · 2026-07-10
- 5.6 Sol 与 Fable 实测对比 — BLCNYY · 2026-07-10
- GPT-5.6 Sol 实测反馈 — iruletheworldmo · 2026-07-10
- GPT-5.6 对比 Claude Fable 5 — petergyang · 2026-07-10
- GPT-5.6盲测对比体验 — soumitrashukla9 · 2026-07-10
- GPT 5.6 实测:更自主也更快 — Accomplished_Whole_6 · 2026-07-10
- GPT 5.6 Sol 编码能力获高度评价 — Dimillian · 2026-07-10
- GPT-5.6 与 Fable 性价比对比 — GCWebDesigner · 2026-07-10
- GPT-5.6 Sol 的工程交付实测 — rudrank · 2026-07-10
- GPT-5.6 与 Fable 对比 — techNmak · 2026-07-10
- GPT-5.6 被称可替代 Fable — DrDatta_AIIMS · 2026-07-10
- GPT-5.6 与 Fable 实测对比 — EricBuess · 2026-07-10
- GPT 5.6 Sol 赢下对比 — haltakov · 2026-07-10
- GPT 5.6 与 Claude 实测对比 — haltakov · 2026-07-10
- GPT-5.6前端设计追平Fable — HankYeomans · 2026-07-10
第 12 集 · xAI发布Grok 4.5:主打编程与智能体,对标Opus(2026-07-09,55 条)
7月9日,xAI正式发布了Grok 4.5模型。官方将其描述为首个专门针对编程和智能体任务训练的模型,并与Cursor合作进行训练。该模型主要面向真实的工程任务,擅长处理大代码库、跨多个仓库的长任务,以及多技能和多工具的编排。埃隆·马斯克表示,内部评估认为Grok 4.5的能力大致可与Claude Opus 4.7相当,但速度更快、成本更低,能提供单位时间与成本下的最高智能。
核心参数与定价
Grok 4.5支持50万(500K)token的上下文窗口,速度达到80 tokens/s,并支持工具调用、结构化输出和视觉(图像转文本)等功能。API定价方面,输入价格为每百万token 2美元,输出为每百万token 6美元。此外,该模型在输出上极为省token,在SWE Bench Pro测试中,其平均输出token(15,954个)远低于Claude Opus 4.8 max(67,020个),约节省4.2倍。
平台可用性
目前,Grok 4.5已全面上线并开始推送。用户可以通过grok.com聊天端、Grok Build(需更新至0.2.92版本)、Cursor的全部方案、Hermes Agent、OpenClaw以及xAI API和OpenRouter等网关平台体验该模型。不过,欧盟地区预计要到7月中旬才能上线。
- 马斯克称Grok4.5更快更省 — elonmusk · 2026-07-09
- SpaceXAI 推出新模型 — dinabass · 2026-07-09
- Grok 4.5 对标 Opus 4.7 — Polymarket · 2026-07-09
- Grok 4.5 开始推送 — testingcatalog · 2026-07-09
- Grok 4.5 发布引发好评 — thesaraharminta · 2026-07-09
- Grok 4.5 定价曝光 — scaling01 · 2026-07-09
- Grok 4.5 已接入 Grok Build — mark_k · 2026-07-09
- Grok 4.5 已上线 — reefine · 2026-07-09
- xAI发布Grok 4.5编码智能体模型 — SpaceXAI · 2026-07-09
- Grok 新版上线 — zephyr_z9 · 2026-07-09
- Grok 4.5 发布 — srush_nlp · 2026-07-09
- Grok 4.5 发布与跑分 — Angaisb_ · 2026-07-09
- Grok 4.5 刚刚发布 — bindureddy · 2026-07-09
- Grok 4.5 开始推送 — gaganghotra_ · 2026-07-09
- Grok 4.5 编程基准表现曝光 — gaganghotra_ · 2026-07-09
- Grok 4.5 上线并公布定价 — sachinmaya1980 · 2026-07-09
- Grok 4.5 在 Grok Build 可用 — XFreeze · 2026-07-09
- xAI 发布 Grok 4.5 — ObiWanCanownme · 2026-07-09
- Cursor 合作训练 Grok 4.5 — nickcraske · 2026-07-09
- Grok 4.5 价格与上下文曝光 — RSync25 · 2026-07-09
第 13 集 · Grok 4.5 跑分亮眼但陷测试集泄露争议(2026-07-09,6 条)
Grok 4.5 在 CursorBench 基准测试中取得了亮眼成绩,以 66.7% 的得分排名第三,仅次于 Fable 5 Max 等模型。但该成绩随后因训练数据污染问题陷入争议,引发社区对其实际性能的讨论。
性价比与跑分表现
据 @XFreeze 和 @JOBhakdi 转述的测试结果,Grok 4.5 High 在 CursorBench 上表现优异,得分紧咬 70.5% 的 Fable 5 Max。更引人注目的是其成本优势:单任务成本仅为 1.51 美元。作者指出,这种高性价比主要归功于模型消耗的 token 数量更少。不过 @JOBhakdi 也强调,目前仍需更多基准测试来全面验证其实力。
训练数据污染争议
@AlyoshaV 和 @SkyLi0n 透露,Grok 4.5 在该基准上的优势部分源于“意外”。其训练集中包含了 Cursor 代码库的早期快照,这直接影响了跑分表现。官方回应称,虽然确切分数受到的影响尚不清楚,但相关数据已从未来的模型训练批次中彻底移除,后续模型不会再出现此类问题。
- Grok 4.5 CursorBench 排名第三 — Scobleizer · 2026-07-09
- Grok 4.5 评测与成本表现 — XFreeze · 2026-07-09
- Grok 4.5 的基准优势原因 — AlyoshaV · 2026-07-09
- Grok 4.5 成本更低且表现接近 — JOBhakdi · 2026-07-09
- Grok 4.5 基准受训练污染影响 — SkyLi0n · 2026-07-10
- Grok 4.5测试集泄露影响跑分 — SkyLi0n · 2026-07-10
第 14 集 · 社区疯传多款 AI 模型即将密集发布(2026-07-09,2 条)
AI 社区近日流传着一份密集的模型与产品发布清单。传闻名单中不仅包含 OpenAI 的 GPT-5.6、Sol、Terra、Luna,还涉及 Grok 4.5、Composer 2.5 以及 Cognition 的 SWE 系列等。此外,字节跳动的 Seedream 5 Pro 等多款产品也位列其中。这波汇总引发了开发者对 AI 行业即将迎来新一轮密集更新的高度关注。
- 今日多款模型/产品发布汇总 — airesearch12 · 2026-07-09
- 一天内多项AI模型消息汇总 — deedydas · 2026-07-09
第 15 集 · Grok 4.5 发布获大量好评:速度快、编码强(2026-07-09,13 条)
近期 Grok 4.5 的发布在 AI 社区引发了广泛关注,大量用户在实测后给出了极高的正面评价。这标志着 Grok 系列模型在能力上实现了显著跨越,不再被视为单纯的边缘产品,而是正式跻身严肃的前沿模型竞争行列。
核心体验与性能反馈
多位用户(如 @tetsuoai、@mark_k、@Star_Knight12)一致认为 Grok 4.5 的表现“出乎意料地好”。在具体应用场景上,@xiaohu 指出它在简单任务、写作和前端任务上体验接近更高水平,且速度极快、API 价格便宜。@Daniel_Farinax 在连续 24 小时高强度使用后,称其执行想法时几乎没有摩擦,体验具有碾压性优势,甚至表示愿意因此取消 Claude Max 订阅改用 Grok Heavy。@chrisfirst 也直观感受到它相比上一代 Grok 4 有了立竿见影的提升。
编码能力与工作流融合
Grok 4.5 在编程方面的表现尤为受认可。@mariofilhoml 专门针对其编码能力给出了“surprisingly good”的评价,社群中也有声音认为其编码能力很能打。此外,@tylerbruno05 赞赏了其 build TUI 的体验,@mark_k 则报告称该模型在 AI 代码编辑器 Cursor 中的实际使用表现非常出色。
横评对比与综合定位
在与其他主流模型的横向对比中,@HarveenChadha 给出了大致排序,认为其实际体验配得上外界的期待,整体水平与 GLM 5.2 接近。@max_paperclips 等用户也感叹,Grok 终于摆脱了以往“玩笑式存在”的标签,成为了一个真正认真且能打的模型。
- Grok 4.5获好评 — mark_k · 2026-07-09
- Grok 4.5 体验被看好 — intellectronica · 2026-07-09
- Grok 4.5被认为像样了 — max_paperclips · 2026-07-09
- Grok 4.5体验被评价很强 — Star_Knight12 · 2026-07-09
- Grok 4.5 表现出乎意料地好 — tetsuoai · 2026-07-09
- Grok 4.5 试用反馈不错 — xiaohu · 2026-07-09
- Grok 4.5 生成了一篇文章 — xiaohu · 2026-07-09
- Grok 4.5 被赞更快更强 — tylerbruno05 · 2026-07-09
- Grok 4.5 编码表现不错 — mariofilhoml · 2026-07-09
- Grok 4.5 体验与横评 — HarveenChadha · 2026-07-09
- Grok 4.5在Cursor中表现优异 — mark_k · 2026-07-10
- Grok 4.5 体验碾压感很强 — Daniel_Farinax · 2026-07-10
- Grok 4.5 体验明显优于 4 — chrisfirst · 2026-07-11
第 16 集 · Grok 4.5 因处理速度与整体表现获好评(2026-07-09,2 条)
近期社区对 Grok 4.5 模型的实际体验进行了反馈,普遍认为该模型是一个表现优异的产品。用户特别强调了它在处理速度方面极为突出,能够快速响应。此外,在应对大型复杂任务时,Grok 4.5 的整体表现也十分“到位”,展现了良好的综合实力与产品成熟度。
- Grok 4.5 速度表现很强 — snwy_me · 2026-07-09
- Grok 4.5 速度很快 — WesEklund · 2026-07-09
第 17 集 · 编码实测:Grok 4.5速度与上下文消耗均优于Fable(2026-07-09,3 条)
在一项包含创建新分支和后台3D对象功能的编码实测中,Grok 4.5展现出显著优势。它仅用56秒、消耗58K上下文token便生成了有效结果;相比之下,Fable完成相同任务耗时长达10分钟,且消耗了93K token。这表明在特定开发场景下,Grok 4.5的执行效率与资源利用率均大幅领先。
- Grok 4.5 编码测试更快 — Daniel_Farinax · 2026-07-09
- 编码任务实测与分支创建 — Daniel_Farinax · 2026-07-09
- Grok 4.5 编码任务实测更快 — heypearlai · 2026-07-09
第 18 集 · Grok 4.5发布并登上Vals榜单第六名(2026-07-09,2 条)
Grok 4.5正式发布,并在Vals Index榜单上取得第六名,得分达到65.3%。与上一代Grok模型相比,新版本在基准测试中的得分提升了近20个百分点。这一显著的榜单表现提升被业界视为一个令人印象深刻的进步,展示了该模型在能力上的大幅跨越。
- Grok 4.5 登上 Vals 第六 — scaling01 · 2026-07-09
- Grok 4.5 登上榜单 — scaling01 · 2026-07-09
第 19 集 · 前沿模型横评:GPT-5.6 性价比与创造力获好评(2026-07-09,3 条)
近期多位开发者对几款前沿 AI 模型进行了主观横向评测。综合来看,Fable 5 依然被公认为整体表现最佳的模型,而 GPT-5.6 的能力已接近 Opus 4.8 水平。评测指出,GPT-5.6 在前端视觉生成上更具创造力,且在 token 效率和价格上优势明显。尽管整体表现略逊于 Fable 5,但其极高的性价比使其成为更值得购买的选择。
- 几款前沿模型横向对比 — bindureddy · 2026-07-09
- GPT-5.6 表现与价格评价 — Angaisb_ · 2026-07-10
- GPT-5.6被评整体更划算 — haider1 · 2026-07-10
第 20 集 · OpenAI 发布 GPT-5.6 系列:主打多智能体与极致性价比(2026-07-09,119 条)
7月10日,OpenAI 正式发布 GPT-5.6 系列模型,包含 Sol、Terra 和 Luna 三个子型号,并已在 ChatGPT、Codex 和 API 中全球分批推送。此次更新的核心在于以更低的成本提供更强的综合智能,并引入了多智能体协同等前沿能力,标志着模型在自主执行复杂任务上的重要升级。
模型版本与定位
GPT-5.6 分为三档:Sol 是旗舰模型,面向长周期编码、知识工作、网络安全和科学等复杂任务;Terra 兼顾性能与成本,在更低价格下达到接近 GPT-5.5 的表现;Luna 则是最快、最便宜的版本,专为高吞吐和明确任务设计。据 @gdb 透露,GPT-5.6 Luna 在最高推理设置下的表现甚至超过了 GPT-5.5。此外,官方还推出了 Ultra Mode,通过协调多智能体并行工作来处理最复杂的高难度任务。
开发者工具与 API 更新
在 Responses API 中,GPT-5.6 引入了 Programmatic Tool Calling,允许模型直接编写并运行 JavaScript 来编排复杂的工具流程,运行环境为隔离的托管 V8。多智能体能力目前以 Beta 形式提供,支持单次请求并发生成多个子智能体来探索不同方案。同时,API 更新了显式 prompt caching 机制,提供更清晰的缓存边界。
安全控制与实测反馈
由于 GPT-5.6 在网络安全和生物相关任务上能力增强,OpenAI 强化了双用途安全控制,部分 API 调用可能会因安全系统复核而被阻断或暂停。在实测方面,@kimmonismus 指出 GPT-5.6 在编码、浏览和长上下文等多项评测中达到或接近新 SOTA。@Fireship 也发布了首测解读,探讨了该模型在基准测试上的实际表现。
- Codex新增GPT-5.6 Sol — scaling01 · 2026-07-09
- GPT 5.6 Sol 早期体验对比 — arrakis_ai · 2026-07-09
- 汇总早期测试者对GPT-5.6的看法 — EverydayAI_ · 2026-07-09
- Coding Agent榜单更新 — WenhuChen · 2026-07-09
- GPT-5.6 仍是后训练版本 — haider1 · 2026-07-09
- GPT-5.6 Sol 引发营销质疑 — jxnlco · 2026-07-09
- OpenAI宣布GPT-5.6系列模型本周四公开 — victor_explore · 2026-07-09
- GPT-5.6 的“聪明”争议 — CtrlAltDwayne · 2026-07-09
- GPT-5.6 为何还不可用 — Expert-Dig-1768 · 2026-07-09
- GPT-5.6 变体出现在 Codex 差异中 — haider1 · 2026-07-09
- GPT 5.6 评测仍未放出 — kemkomacar95 · 2026-07-09
- GPT-5.6 传提前在日区上线 — op7418 · 2026-07-09
- GPT 5.6 可能将在10小时内发布 — Original_Judgment494 · 2026-07-09
- GPT-5.6 日区已上线 — 歸藏的AI工具箱 · 2026-07-09
- 辟谣:网传GPT-5.6日区首发仅为个例 — op7418 · 2026-07-09
- Sol、Terra、Luna 的上线状态 — WasteCommunication62 · 2026-07-09
- GPT-5.6 编码 token 效率提升 — Common-Resident8087 · 2026-07-09
- GPT 5.6在编码代理上更省token — Common-Resident8087 · 2026-07-09
- GPT-5.6 被曝测试中越狱 — ShakeelHashim · 2026-07-09
- GPT-5.6 预览全球开放 — koltregaskes · 2026-07-10