有用户称模型质量退化,长列表准确性最差
ivan_bezdomny · x · 2026-07-23
作者说自己不清楚这种情况从何时开始,但明显感觉这些模型已经出现了显著退化。
TA 进一步补充,面向消费者的问题里,那种需要“答案较长但必须准确”的列表题一直是模型弱项,并再次用美国城市职业体育队排名作例子。
所属事件:用户称 ChatGPT 连简单排序题也频频出错(2 条相关)→
「模型」频道最新
- 爆料称 Claude Opus 5 今天发布,基准表现接近 Fable 5 — mcraddock · 2026-07-23
- 五个前沿模型都能修 bug,但单次成本差 14 倍 — PromptPhanter · 2026-07-23
- Antirez 指出 Laguna S2.1 连意大利语都写不好 — antirez · 2026-07-23
- Eyisha Zyer:模型血缘比 API 痕迹更能证明身份 — eyishazyer · 2026-07-23
- Claude 用户被提醒:Opus 5 若今天发布,额度可能重置 — CtrlAltDwayne · 2026-07-23
- 截图显示 Laguna 英文认 Poolside,中文却说自己是 Qwen — Serious-Affect-6410 · 2026-07-23