传 GPT-6 Sol 在 DeepSWE 等基准反而逊于 5.6 Sol:被讽只是改名 Terra
kristoph · x · 2026-09-23
有爆料称 GPT-6 Sol 在 DeepSWE、computer use 和 research debugging 上表现比 5.6 Sol 更差,在 cyber 能力上也没有提升——更便宜更高效,但不是更聪明的模型(未证实)。Kristoph 评论讽刺道:他们基本上就是把 Terra 改了个名而已。
所属事件:GPT-6 Sol/Luna 评测出炉:更便宜更少幻觉,但部分基准不敌前代(16 条相关)→
「模型」频道最新
- 阿里吴泳铭称 Qwen 取得 RSI 进展,规划 5-10T 参数模型 — teortaxesTex · 2026-09-23
- 给 Opus 5.5 接上创作工具后问它梦见什么,回答很有料 — angrypenguinPNG · 2026-09-23
- Yuchen Jin 实测 Opus 5.5 后判断:前沿模型编码能力已趋平台期 — Yuchenj_UW · 2026-09-23
- Forward Future 用 Opus 5.5 完成 8 项实测:建城、做游戏、动画 — MatthewBerman · 2026-09-23
- Matthew Berman 实测称 Opus 5.5 是全球最强模型 — MatthewBerman · 2026-09-23
- 花 5 美元微调 10 分钟,Qwen3.6 GPQA 涨 8% — simonguozirui · 2026-09-23