GPT-6.1 Sol 多项实测:性能逼近 Astra,成本大幅下降
OpenAI 发布 GPT-6.1 Sol 后,第三方评测集中出炉,普遍结论是性能接近旗舰 GPT-6 Astra 而成本大幅降低。Artificial Analysis 的评测显示 GPT-6.1 Sol 将 OpenAI 的成本效率前沿整体外推:Max effort 下单 Intelligence Index 任务成本 $0.72,不到 GPT-6 Astra 的对应水平,且每任务成本比 GPT-6 Sol 再低约 30%。多位独立开发者的实测也趋于一致。
已确认
- Pawel Huryn 在 2 个真实代码仓库植入 105 个 bug 进行盲测(Bug Hunt Bench,单 prompt,按成本/时间/轮次多维展示):max/xhigh 档下 GPT-6.1 Sol 修复约 44 个 bug 仅花 $6.56,而 GPT-6 Astra 修复 45 个花费 $33;他此前已公布全部 effort 档位成绩(max/xhigh 为 n=3,其余 n=2),认为结合成本考虑没有理由再用 Astra
- adonissingh 在 eyebench-v3 上测得 GPT-6.1-Sol 排名第二,性能接近 Astra 但便宜约 3.8 倍,价格约为 Opus-5.5 的 1/8;成本维度 Pareto 最优,但输出 token 效率仍低于 Astra 各档
- cedricchee 实测 3D 生成质量接近 Astra 且速度快约 30%;codestantine 在自建低资源语言翻译基准上称其超过 Astra(由 nickbaumann 转发)
- danielmckinn0n 在 GamowLabs RareBench 上测得 GPT-6.1 Sol 以约 1/4 价格几乎追平 Astra
- Artificial Analysis 已上线 GPT-6.1 Sol 全部 effort 档位(Low 至 Max)评测,并同步更新 Intelligence Index v4.3(以 AutomationBench-AA 替换旧项)
- Reddit 用户 therealjerseytom 反馈其「符合宣传」:6 Astra 能做的挑战性工作它也能做,但 token 成本显著更低,尤其在需要返工重做的场景下优势明显
尚未确认
- BridgeBench 实测显示 GPT-6.1 Sol 仅比 GPT-6 Sol 高 3 分、落后 GPT-6 Astra 82 分,与 OpenAI 官方「接近 Astra 级智能」的说法及其他评测存在明显分歧,结论尚待更多独立验证
- Wsz2020 基于 AA 数据指出「Sol max 比 Opus 5.5 max 便宜 88%」的表面数字有误导性(因 Opus 定价结构不同),跨模型直接比价需谨慎
- banteg 转发的 Runescape Bench(恶搞性质榜单)显示其排第二、价格约为 Astra 的 10%,参考价值有限
- 用户 chogku 称 GPT-6.1 Sol + Opus 5.5 组合接近 Astra 水平且成本更低(由 rudrank 转发),属个人观点
为什么重要
Pawel Huryn 强调,与被视为「削弱版 GPT-5.6 Terra」的 GPT-6 Sol 不同,GPT-6.1 Sol 是真实的能力进步。若低成本高性能的结论在更多场景成立,将显著改变前沿模型的性价比格局,压缩 Astra 等旗舰在日常编程与推理任务中的使用空间。
2026-09-30 ~ 2026-10-02 · 21 条相关
- 第 1 集:OpenAI 发布 GPT-6 Sol 与 Luna:价格减半、幻觉大降,但非全面超越前代(2026-09-23,92 条)
- 第 2 集:GPT-6 Sol/Luna 上线口碑分化:降价换质量引争议(2026-09-23,9 条)
- 第 3 集:LMArena 上线 GPT-6 Sol/Luna 实测投票(2026-09-23,2 条)
- 第 4 集:四款新模型一周改写性价比前沿,Opus 5.5 登顶(2026-09-23,2 条)
- 第 5 集:OpenAI 与 Anthropic 同日降价,掀新一轮模型价格战(2026-09-23,7 条)
- 第 6 集:实测:GPT-6 Sol 随算力近线性提升,Bug Hunt 仍不敌 Opus 5.5(2026-09-23,3 条)
- 第 7 集:Bug Hunt Bench 实测 GPT-6:Astra 居首,Sol 版本大幅退化(2026-09-24,2 条)
- 第 8 集:GPT-6 命名流出:Sol 对应 Terra,Luna 疑退化(2026-09-24,3 条)
- 第 9 集:Bug Hunt Bench 发布:105 个真实 bug 横评前沿编码模型,成本差 200 倍(2026-09-24,3 条)
- 第 10 集:GPT-6 Sol/Luna 登场:低价 API 与三档定价引发关注(2026-09-25,2 条)
- 第 11 集:网友推测 OpenAI 高效新模型意在腾算力并适配超快推理(2026-09-25,2 条)
- 第 12 集:GPT-6 Sol 被指遭低估:机器人任务成绩升成本降(2026-09-25,2 条)
- 第 13 集:GPT-6.1 Sol 发布:Astra 级智能、价格约 1/5(2026-09-29,32 条)
- 第 14 集:GPT-6 Astra Ultrafast 曝光:Codex 提速最高 8 倍(2026-09-30,2 条)
- 第 15 集:GPT-6.1 Sol 多项实测:性能逼近 Astra,成本大幅下降(2026-09-30,21 条)
一手来源
- GPT-6.1 Sol 刷新 OpenAI 成本效率前沿,单任务成本仅 GPT-6 Astra 的 1/4 — ArtificialAnlys ·
- 实测 105 个植入 Bug:GPT-6.1 Sol 性能近 Astra,成本仅 1/5 — PawelHuryn ·
- Artificial Analysis 上线 GPT-6.1 Sol 各档位评测,附 Intelligence Index v4.3 — ArtificialAnlys ·
- 实测:GPT-6.1 Sol 3D 生成接近 Astra 水准,速度还快约 30% — cedric_chee · 2026-09-30
- GPT-6.1-Sol 登 eyebench-v3 第二,价格仅 Opus-5.5 的约 1/8 — adonis_singh · 2026-09-30
- 成本 Pareto 领先,输出 token 效率仅次于 Astra — adonis_singh · 2026-09-30
- GPT 6.1 Sol 上 BridgeBench:仅比前代高 3 分,落后 GPT 6 Astra 82 分 — RexDouglass · 2026-09-30
- GPT-6.1 Sol 实测:44 分仅花 6.56 美元,性价比碾压同门 — PawelHuryn · 2026-09-30
- GPT-6.1 Sol 实测:105 个植入 bug 修 44 个,成本仅为上代 1/15 — PawelHuryn · 2026-09-30
- GPT-6.1 登 Runescape Bench 第二名,价格仅 Astra 一成 — banteg · 2026-09-30
- Bug Hunt Bench 编程模型实测榜更新:GPT-6.1 Sol xhigh 档近乎免费 — PawelHuryn · 2026-09-30
- GPT-6.1 Sol 实测:完成同等工作量,token 成本大幅低于 6 Astra — therealjerseytom · 2026-09-30
- GPT-6.1 Sol 与 Opus 5.5 组合被称接近 Astra 水平且成本更低 — rudrank · 2026-10-01
- 开发者实测:GPT-6.1 Sol 低资源语言翻译超越 Astra — nickbaumann_ · 2026-10-01
- GPT-6.1 Sol 各 effort 档基准出炉:对比 Astra 更省钱 — PawelHuryn · 2026-10-01
- 博主实测 GPT-6.1 Sol 全档推理力度,Astra 更快但更贵 — PawelHuryn · 2026-10-01
- GPT-6.1 Sol 每任务成本再降约 30%,已达 GPT-5.6 Sol 三成水平 — ArtificialAnlys · 2026-10-01
- 【源头】GPT-6.1 Sol 刷新 OpenAI 成本效率前沿,单任务成本仅 GPT-6 Astra 的 1/4 — ArtificialAnlys · 2026-10-01
- 【源头】Artificial Analysis 上线 GPT-6.1 Sol 各档位评测,附 Intelligence Index v4.3 — ArtificialAnlys · 2026-10-01
- GPT-6.1 Sol max 比 Opus 5.5 便宜 88%?实测账本揭真相 — Wsz2020 · 2026-10-02
- GPT-6.1 Sol 以四分之一价格逼近 Astra,成本性价比飞速提升 — danielmckinn0n · 2026-10-02
另有 3 条近重复转述:cedric_chee · adonis_singh · PawelHuryn