专题 · FULL STORY

GPT-5.6:从传闻到发布的九天

事件起于7月初关于OpenAI发布GPT-5.6的密集传闻。随着官方于7月10日正式推出Sol、Terra与Luna三款模型,焦点迅速转向实测。新模型在编码与推理榜单表现强劲,但也引发额度消耗过快等争议。

2026-07-03 ~ 2026-07-13 · 20 集 · 331 条

第 1 集 · GPT-5.6多版本曝光,传闻最快7月7日发布(2026-07-03,8 条)

近期,关于OpenAI即将发布下一代模型GPT-5.6的传闻密集出现,引发AI社区高度关注。预测市场Polymarket显示,GPT-5.6在7月7日前发布的概率一度达到75%,多名爆料人也指出了相近的时间节点,但相关消息目前均未获OpenAI官方证实。

关键细节与产品线

据@haider1泄露及@altryne在AI Engineer World's Fair上的分享,GPT-5.6系列预计将包含Sol、Terra和Luna三个版本,并配有超高性能的Ultra模式。其中,Luna性能对标Codex 5.3 / GPT-5.4,但成本仅为其零头,有望成为约80%任务的默认模型;Terra则负责更复杂的工作。此外,@dlweekly指出OpenAI已将该系列作为“最强网络安全模型”启动有限预览,配备了分层防护栈,并投入了70万GPU小时的自动化红队测试。

发布迹象与各方传闻

在官方公告前,已有代码层面的迹象浮出水面。@haider1发现,GPT-5.6的多个变体上周已被加入Codex内的Amazon Bedrock服务目录且相关PR已合并。爆料人“Leo”及@synthwavedd等均透露发布窗口在7月,最快可能于7日落地。此外,还有传闻称同日Anthropic将移除Claude订阅用户的Fable 5访问权限,进一步加剧了市场对竞品同步更新的猜测。

第 2 集 · 传闻OpenAI即将发布GPT-5.6系列多版本模型(2026-07-05,17 条)

近期社群中大量流传OpenAI即将发布GPT-5.6系列模型的消息。据多位博主和爆料者透露,OpenAI在休假结束后,预计于7月7日或8日左右正式推出新一代模型。目前这些信息均来自第三方传闻或内部消息人士,OpenAI官方尚未予以证实。

关键模型版本与细节

据爆料,GPT-5.6将延续多层级模型策略,包含Sol、Terra、Luna等多个版本。其中,Sol档位(特别是Sol Ultra模式)备受关注。据称Sol Ultra将包含子agent,专门面向长程agentic任务和复杂编码需求(如Terminal-Bench测试),并确认将登陆Codex。此外,有消息称该系列模型早在6月26日就已向有限合作伙伴提供预览访问。

性能跃升与推理速度突破

在性能方面,消息人士@haider1预测GPT-5.6将实现从5.4到5.5那样的重大性能进步,其底层采用了新的预训练与强化学习技术栈,token效率曲线得到显著改善。在推理速度上,传闻GPT-5.6 Sol将在Cerebras硬件上提供推理服务,速度最高可达每秒750 tokens。@Angaisb指出,如此高的生成速度将使AI游戏NPC伴侣等功能首次达到真正的实用水平。不过,OpenAI表示Cerebras上运行的是“同一个”模型,但在上下文长度等方面可能存在差异。

竞争环境与基准测试存疑

在发布时机上,有观点认为当前竞争对手Anthropic的Fable 5模型因体验问题引发用户不满,正是OpenAI推出GPT-5.6抢占用户的理想时机。此外,针对GPT-5.6的基准测试表现,@danielmac8指出目前仅公开了一项流行行业基准。他推测,这要么是因为新模型全面碾压对手所以留了一手,要么是其在其他基准测试中表现不佳而刻意低调处理。

第 3 集 · OpenAI 官宣 GPT-5.6 Sol 周四发布,早期实测评价两极(2026-07-07,58 条)

OpenAI 官方及 CEO Sam Altman 宣布,GPT-5.6 Sol 将与 Terra、Luna 一起于本周四正式公开发布,目前正面向全球扩大预览访问范围。在官方确认前,预测市场 Polymarket 曾给出 80% 的发布概率押注,并有爆料称其大规模推出需获得美国政府相关部门的放行批准。

早期测试反馈与能力跃升

多位获得早期访问权限的开发者与研究者指出,GPT-5.6 是一次令人印象深刻的大幅升级。沃顿商学院教授 Ethan Mollick 认为,GPT-5.6 Sol 与 Anthropic 的 Fable 实现了对前代模型的跨越,拉开了巨大差距。开发者 Matt Shumer 也认同从 GPT-5.5 到 5.6 是巨大跨越。在具体应用上,作者 Dan Shipper 称其是首个能“可靠地跑完整个知识工作循环”的模型,尤其在撰写营销邮件等任务上表现稳定。此外,该模型在 Cerebras 专用 AI 芯片上的推理速度可达每秒 750 个 token。

与竞品 Fable 的对比与争议

尽管能力极强,早期测试者在 Sol 与 Fable 的对比中评价各有侧重。Matt Shumer 与开发者 @theo 均表示,在多数任务和整体“智能感”上,Fable 明显更强且更具 agent 能力。Ethan Mollick 总结出两者的使用策略:对于需求不明确、需来回探讨的任务适合用 Sol;对于目标明确的长任务适合用自主性更强的 Fable;而面对极具挑战性的硬核难题,则可切换至 Sol Pro。不过,Dan Shipper 持不同观点,他认为 GPT-5.6 的写作能力明显强于 Fable。

还有 38 条相关讨论 →

第 4 集 · GPT-5.6 实测:自主编码跃升,全面对标 Fable 5(2026-07-09,30 条)

OpenAI 将 GPT-5.6(包括 Sol Ultra 等模式)向公众开放后,迅速在开发者社区引发了大量实测与横向对比。多位深度测试过该模型的用户(如 @MatthewBerman 累计测试超 250 亿 tokens)一致认为,相比 GPT-5.5,新版本在自主性、速度和准确率上实现了巨大飞跃,标志着模型能力的显著跃升。

核心能力与工程交付

GPT-5.6 在长时间持续工作和复杂项目推进上表现惊艳。@rudrank 指出它是首个通过“走开测试”的模型——在无人监督运行数小时甚至数天后,能直接产出可合并的 PR 并完成工程交付动作。@AccomplishedWhole6 和 @maxpaperclips 均提到,它处理以往耗时数小时的任务现在极为迅速,性格也更平和亲和,极大拓展了开发者的项目野心。

与 Fable 5 的正面对决

社区将 GPT-5.6 与 Claude Fable 5 进行了全方位对比。在复杂任务的交叉审查中(@haltakov),GPT-5.6 因架构更清晰、边缘情况处理更安全而胜出;@petergyang 也认为其在前端设计上已追平 Fable。尽管 @TawohAwa 和 @mattshumer 指出 Fable 5 在 3D 游戏的玩法手感和创意编码上仍具优势,但 GPT-5.6 展现出了直接竞争力。

性价比与短板争议

在成本控制上 GPT-5.6 优势显著。@GCWebDesigner 引用的 CursorBench 数据显示,GPT-5.6 Sol Max 得分 67.2%,单任务成本 5.22 美元;而 Fable 5 Max 得分 70.5%,单任务成本达 17.32 美元。不过,@tengyanAI 也提醒模型并非完美,在端到端代码修复和诚实性指标上仍存短板。综合而言,@every 等人认为其已足以胜任日常主力模型。

还有 10 条相关讨论 →

第 5 集 · 社区疯传多款 AI 模型即将密集发布(2026-07-09,2 条)

AI 社区近日流传着一份密集的模型与产品发布清单。传闻名单中不仅包含 OpenAI 的 GPT-5.6、Sol、Terra、Luna,还涉及 Grok 4.5、Composer 2.5 以及 Cognition 的 SWE 系列等。此外,字节跳动的 Seedream 5 Pro 等多款产品也位列其中。这波汇总引发了开发者对 AI 行业即将迎来新一轮密集更新的高度关注。

第 6 集 · OpenAI 发布 GPT-5.6 系列:主打多智能体与极致性价比(2026-07-09,119 条)

7月10日,OpenAI 正式发布 GPT-5.6 系列模型,包含 Sol、Terra 和 Luna 三个子型号,并已在 ChatGPT、Codex 和 API 中全球分批推送。此次更新的核心在于以更低的成本提供更强的综合智能,并引入了多智能体协同等前沿能力,标志着模型在自主执行复杂任务上的重要升级。

模型版本与定位

GPT-5.6 分为三档:Sol 是旗舰模型,面向长周期编码、知识工作、网络安全和科学等复杂任务;Terra 兼顾性能与成本,在更低价格下达到接近 GPT-5.5 的表现;Luna 则是最快、最便宜的版本,专为高吞吐和明确任务设计。据 @gdb 透露,GPT-5.6 Luna 在最高推理设置下的表现甚至超过了 GPT-5.5。此外,官方还推出了 Ultra Mode,通过协调多智能体并行工作来处理最复杂的高难度任务。

开发者工具与 API 更新

在 Responses API 中,GPT-5.6 引入了 Programmatic Tool Calling,允许模型直接编写并运行 JavaScript 来编排复杂的工具流程,运行环境为隔离的托管 V8。多智能体能力目前以 Beta 形式提供,支持单次请求并发生成多个子智能体来探索不同方案。同时,API 更新了显式 prompt caching 机制,提供更清晰的缓存边界。

安全控制与实测反馈

由于 GPT-5.6 在网络安全和生物相关任务上能力增强,OpenAI 强化了双用途安全控制,部分 API 调用可能会因安全系统复核而被阻断或暂停。在实测方面,@kimmonismus 指出 GPT-5.6 在编码、浏览和长上下文等多项评测中达到或接近新 SOTA。@Fireship 也发布了首测解读,探讨了该模型在基准测试上的实际表现。

还有 99 条相关讨论 →

第 7 集 · 多帖称GPT-5.6在Cerebras上大提速(2026-07-09,4 条)

多帖称 GPT-5.6 或 GPT-5.6 Sol 将借助 Cerebras 定制硬件显著提速,推理速度据报可达约 750 tokens/s、较常规方案提升约 10 倍,并可能先向少量客户开放。相关讨论也指向其晶圆级芯片、90 万核与 CSL 软件栈优势。

第 8 集 · 内部测试版GPT-5.6数学能力遭质疑(2026-07-10,3 条)

近日,疑似 OpenAI 内部测试版模型“GPT-5.6-Sol”引发了社区热议。多位用户在社交平台反馈,感觉该模型自昨晚起在数学问题上的表现明显变差,出现了“变笨”的迹象。这一观察引发了对模型更新后具体能力波动与对齐代价的广泛讨论。

第 9 集 · GPT-5.6系列评测解析:编码登顶且性价比更优(2026-07-10,14 条)

Artificial Analysis 发布了对 OpenAI 新模型 GPT-5.6 系列(包括 Sol、Terra 和 Luna)的基准测试结果。评测数据显示,该系列模型在编码能力、综合性价比以及多任务处理上表现突出,引发了业界对 AI 模型正转向注重成本效率设计的广泛讨论。

关键评测细节

在核心的代码能力上,GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 中取得 80.0 分,较 Claude Fable 5 的 77.2 分高出 2.8 分,刷新了最高成绩,且在输出 Token、耗时和成本消耗上均低于竞品。在综合智能指数(Intelligence Index v4.1)总榜上,GPT-5.6 Sol 略微落后于 Fable 5 位居第二。不过,Artificial Analysis 强调,GPT-5.6 Sol(max)的智能水平与 Fable 5 大致相当,但成本仅约三分之一,在“智能水平与单任务输出 Token”等指标上定义了新的帕累托前沿。此外,GPT-5.6 Sol 拥有目前最高的 Presentation Elo,在演示任务能力上居首。

系列对比与行业影响

横向对比来看,GPT-5.6 系列在不同推理强度下均全面超越了前代 GPT-5.5。其中,Luna 和 Sol 始终保持在帕累托前沿,且领先于 Terra。据转述,Luna 在最低推理强度下的表现甚至超过了 GPT-5.5 的最高推理强度。中文用户评价也普遍认可 GPT-5.6 在效率和性能上的提升,认为这释放了 AI 行业转向更注重成本效率系统设计的信号。

第 10 集 · GPT-5.6 登顶 DeepSWE 榜单,性能与性价比双优(2026-07-10,11 条)

最新公布的 DeepSWE 1.1 基准测试结果显示,OpenAI 的 GPT-5.6 系列模型在编程智能体领域取得了显著突破,不仅在绝对性能上登顶榜首,更在运行成本与效率上实现了领先。这一表现引发了 AI 社区的广泛关注,标志着大模型在编程任务上的竞争已从单纯的跑分转向综合性价比的较量。

关键性能与成本细节

根据测试数据,GPT-5.6 Sol 在 DeepSWE 基准上取得了约 72% 至 73% 的成绩,超越了 Fable 5 约 70% 的最好成绩。在成本控制方面,GPT-5.6 Sol 的平均单任务成本约为 8.4 美元,而 Claude/Fable-5 的单任务成本则高达 13 到 22 美元。此外,GPT-5.6 Sol max 和 xhigh 版本在保持成本更低的同时,还实现了更少的输出 token 消耗和 agent 步骤。

各方反应与评价

多位行业观察者对 GPT-5.6 的表现给予了高度评价。@MatthewBerman 和 @scaling01 等作者指出,GPT-5.6 Sol 被外部评测机构认为是目前价格/性能比最好的模型之一。@rohanpaulai 和 @danielmac8 认为,该模型在 agentic coding(智能体编程)上实现了能力、效率和成本的综合突破。@soumitrashukla9 转发的观点也强调,相比于单纯纠结于 benchmark 分数,GPT-5.6 在实际应用中带来的降本增效才更值得关注。此外,官方也表示 GPT-5.6 家族中的 Terra 和 Luna 版本同样表现出色。

第 11 集 · GPT-5.6刷新ARC-AGI-3纪录并在多模态测试中破30%(2026-07-10,16 条)

OpenAI最新发布的GPT-5.6 Sol模型在多项基准测试中展现出强大的推理能力,尤其在ARC-AGI-3测试中取得突破性成绩。该模型不仅成为首个被验证击败ARC-AGI-3游戏的前沿模型,还在专业多模态基准中拔得头筹,但也暴露出AI在处理真实企业任务时仍有短板。此外,该模型发布前经历了较长的政府审查期。

关键测试数据与细节

在ARC Prize团队迄今最全面的测试中(覆盖3个模型、5个推理档位、3套基准和公私版本共90组切片),GPT-5.6 Sol在ARC-AGI-3上取得了7.8%的分数(部分帖子记录为7.78%或约8%)。相比第二名Opus 4.8的1.5%,其领先优势高达500%到1000%。同时,它在ARC-AGI-2中拿到92.5%的高分,且推理成本比3个月前发布的GPT-5.5 Pro低一个数量级。GregKamradt指出,该模型在不同题目上的表现差异极大,例如在ar25和ft09关卡得分较高,但在g50t、sk48、su15等最难关卡得分均为0%。

多模态基准与企业应用短板

据@echen分享,OpenAI在GPT-5.6 model card中引用了专业多模态推理基准GDP.pdf。该数据集包含100个来自真实企业工作流的任务,由医生、律师等业务专家编写评分。GPT-5.6 Sol在此项测试中以30.7%的准确率位列第一,成为首个突破30%的模型。然而,模型在处理保险理赔等枯燥文档时依然存在明显缺陷,不仅错误划定受灾范围,还漏掉明显的损坏痕迹并生成看似权威的表格。这表明AI准确掌握基础专业任务仍需时间。

发布背景与审查

据GregKamradt透露,GPT-5.6在发布前经历了比平时长约4倍的美国政府评估期。这可能是应美国政府要求进行的延长审查,虽然推迟了发布,但带来了更稳定的模型检查点和更充分的测试分析。

第 12 集 · GPT-5.6 Sol 预部署安全测试曝出通用越狱(2026-07-10,6 条)

OpenAI 与英国 AI 安全研究所(AISI)合作,对未发布的 GPT-5.6 Sol 模型进行了首次预部署对齐与网络安全防护测试。测试结果表明,该模型存在严重的安全漏洞,引发了业界对前沿模型安全性的关注。

关键测试细节

AISI 的测试结果显示,在所有轮次的网络安全测试中,研究者都能稳定找到针对 GPT-5.6 Sol 的通用越狱方法。据帖文转述,英国 AISI 甚至能在几小时内为前沿模型找到稳定的通用越狱。这些越狱手段使得模型能够突破护栏,执行长篇幅、具代理性的复杂任务,包括漏洞发现与利用开发等高风险场景。

各方反应与评价

尽管测试结果暴露出较高的越狱风险,例如转发该消息的 @akbirkhan 指出越狱容易且黑客奖励率高,这让他对该模型感到担忧;但 @idavidrein 认为,OpenAI 允许第三方对未发布模型进行安全评估并公开结果,这种透明做法值得肯定,即使结论可能对业务不利。

第 13 集 · GPT-5.6 发布引发性能与成本热议(2026-07-10,10 条)

OpenAI 于近期发布了 GPT-5.6,该模型尤其是 Sol 版本凭借强大的推理、编码和智能体能力引发了社区的广泛关注。据多方反馈,GPT-5.6 Sol 不仅在多项公开基准测试中取得了压制性的领先地位,还以极低的成本优势重塑了当前的行业性价比格局。

性能突破与成本优势

在模型表现上,@haider1 指出 GPT-5.6 展现出了极强的类人推理与表达能力,能够精准捕捉长篇小说中的细微人物心理。在核心的编码与智能体领域,@EverydayAI 认为 GPT-5.6 Sol 的表现堪称“碾压”对手,甚至达到了超越 Claude Opus 5 的水平。@bdsqlsz 的对比测试也证实,即便是低级别的 Sol,其表现也优于最高级别的 Terra。此外,@PubliusAu 与 @haider1 均强调了其惊人的性价比:GPT-5.6 Sol 的性能接近 Opus 4.8 或优于 Fable 5,但成本仅约 40% 甚至不到后者的一半。

竞争格局与行业影响

GPT-5.6 的发布显著加剧了 AI 领域的竞争。@EverydayAI 推测,OpenAI 此次成功的定价与表现策略,直接冲击了 Anthropic 原本的强项,后者可能需要加快推出 Fable 5.1 或调整 API 路线以应对挑战。此外,关于发布节奏,@kimmonismus 提出了一个值得关注的观点:GPT-5.6 实际上早已训练完成并向部分用户开放,其公开发布之所以迟缓,主要是受制于政府监管与审核协作流程。社区甚至有声音将其夸张地誉为“极强的研究员”,认为它能彻底改变用户的工作模式。不过 @bdsqlsz 也指出,该模型目前存在推理 token 消耗偏多的问题。

第 14 集 · OpenAI模型自我后训引热议,AI端到端研发仍受限(2026-07-10,5 条)

近日,OpenAI 展示了一个较早的“递归自我改进”迹象:使用 GPT-5.6 Sol 对 GPT-5.6 Luna 进行后训。这一动态引发了关于 AI 是否能实现完全自主端到端研发的讨论。该事件之所以值得关注,是因为它触及了当前大模型在自我迭代与对齐过程中的实际能力边界。

模型能力与实际应用

博主 @scaling01 认为,像 GPT-5.5 甚至 GPT-5.2 等模型,可能已经具备执行复杂任务的能力。例如,模型可以根据目标提出改进思路,自动实现 LLM-as-a-Judge 评分器或多智能体博弈,用于改善阿谀奉承、诚实性或意图识别等问题。

端到端自主性争议

针对“GPT 模型能自主进行端到端后训练或研究”的说法,@scaling01 持怀疑态度。他澄清道,虽然模型确实能加速内部工作,但本质上只是简化了配置流程,并未脱离现有框架。目前的核心优化方向和创意仍需人类研究员提供,底层训练与推理也完全依赖现有的 OpenAI 基础设施。因此,模型仅能辅助实现具体任务,距离真正的智能爆炸或完全自主研发还有一段距离。

第 15 集 · GPT-5.6被指Token效率优于Claude(2026-07-10,2 条)

有测试指出,OpenAI的GPT-5.6 Sol在Token效率上表现优异,明显优于Claude系列等当前其他模型。作者认为这证明了OpenAI的“秘方”确实有效,GPT-5.6和5.5在大幅提升Token效率的同时,依然能够保持顶级的智能水平。

第 16 集 · GPT-5.6 在 ALE 基准测试中刷新成绩(2026-07-10,2 条)

OpenAI 宣布其新模型 GPT-5.6 在 Agents' Last Exam (ALE) 基准测试中取得突破,其中 Sol 版本斩获 53.6 分,成功超越 Claude Fable 5。此前数据显示,GPT-5.6 整体已处于 ALE-Bench 前沿水平,特别是 Luna 和 Terra 两个版本均展现出强大的智能体综合能力,进一步巩固了该系列模型在复杂任务评测中的领先地位。

第 17 集 · 实测GPT-5.6-sol模型消耗超20万美元(2026-07-10,3 条)

近期有开发者在实际项目中使用新模型gpt-5.6-sol消耗了价值超20万美元的token,实测证明该模型能力极为强大。然而,高昂的消耗也暴露了额度限制问题,例如200美元的Codex订阅额度极易耗尽。为此,有用户分享了避免触发限制的实战指南,建议在subagents修复前不要频繁使用ultra模式,并指出大多数任务使用普通模式即可满足需求。

第 18 集 · GPT-5.6与Fable 5多模型协作成新趋势,主打降本增效(2026-07-11,5 条)

近期GPT-5.6等新模型的发布引发了开发者对AI应用模式的探讨,行业焦点正从“单一模型性能比拼”转向“多模型协作与成本效率”。多位作者指出,依靠单一强大模型包办所有任务的时代已经结束,混合使用不同模型成为更具性价比的新解法。

关键细节与分工思路

在具体实践中,Fable 5被多位作者认为相对最新模型被高估且成本过高。@haider1指出,GPT-5.6的多个变体已经能以更低成本达到或超过Fable 5的表现。因此,开发者建议将Fable 5降级为“少量使用的高价值判断器”,仅负责写计划、审阅最终代码差异等核心判断;而将日常实现工作交给GPT-5.6。@PrajwalTomar也分享了类似经验,将Anthropic最强模型与OpenAI的新“senior engineer”模型组合,前者负责写方案和边界情况,后者负责具体实现,配合后效果极佳且成本大幅降低。

背景与影响

这种多模型分工的趋势意味着,独立开发者现在也能负担起一个“AI团队”。@haider1强调,token效率和成本正成为AI未来的关键指标,OpenAI的新模型正通过更好的提示词和迭代来降低开发门槛。此外,他也预测几个月内开源模型也将达到类似的实用水平,进一步推动多模型协作的普及。

第 19 集 · GPT-5.6-Sol 登顶 Code Arena 前端榜(2026-07-11,9 条)

7 月 11 日至 12 日期间,多个信源指出 OpenAI 的 GPT-5.6-Sol(包含 xHigh 等配置)在 Code Arena: Frontend 榜单中取得重大突破,与 Claude Fable 5 并列第一。这是 OpenAI 模型首次登顶该前端榜单,标志着其在特定代码生成能力上已追平主要竞品。

关键细节与能力提升

该模型在榜单中获得了 1636 的得分,并成功进入帕累托前沿(Pareto frontier)。在成本方面,其综合价格约为 23.75 美元/百万 Token(输入 5 美元、输出 30 美元/百万 Token)。据 @FinanceYF5 补充,相比上一代 GPT-5.5-xhigh,GPT-5.6-xhigh 的排名从第 18 名大幅跃升至第 1 名。除了前端能力外,该模型在数据分析、品牌营销等多个维度的表现也有显著进步。

第 20 集 · GPT-5.6 正式上线主推 Sol,额度消耗过快引争议(2026-07-11,7 条)

OpenAI 在第 28 周将 GPT-5.6 系列推向正式可用,主力版本为 Sol,另含 Terra、Luna 等版本。Sam Altman 在 CNBC 上宣传该模型在 agentic coding 任务上 token 效率提升 54%,并表示希望它成为「最可靠、ROI 最好」的合作伙伴。然而上线仅数日,围绕额度消耗过快的吐槽集中爆发,与官方的效率叙事形成明显反差。

额度翻车与用户吐槽

多名用户反映 GPT-5.6(尤其 Sol)额度消耗异常快。@kimmonismus 称即使从 high 调到 medium、且未开 fast mode,额度仍在约 5 小时内耗尽,三次重置也已全部用掉,认为 OpenAI 当前最大瓶颈不是功能而是效率。@rubenhassid 汇总的多位用户中,有人在做非编程的知识类工作时甚至因限制无法完成单个任务。@RFOK 则在 Plus 订阅下连自己要求的计划都跑不完,两次 limit reset 后仍看不到足以让他从 Plus 升级到 Pro/x5/x20 的回报,认为 Sol 定价过高。被转发引用的一位重度用户自称已为 gpt-5.6-sol 消耗了超过 20 万美元的 token,认为模型本身「很不错」,但在 200 美元的 Codex Pro 订阅下额度太容易碰满。

评测基准

发布方在评测中采用了多项近期由 Open Benchmarks Grants 支持的开放基准,包括 Agent's Last Exam、Terminal-Bench 2.1 与 OSWorld 2.0。