连续三款前沿模型遭用户回退,感知质量下滑引发争论
alexisgallagher · x · 2026-09-12
@kunchenguid 观察到反常现象:连续三款最新前沿模型发布后,大量用户选择回退到旧版本:
- Opus 5:反馈普遍负面——沟通能力差、缺乏上下文就急于下结论、反复犯错,甚至被用户专门建了一个吐槽网站;许多人(含作者本人)弃用 5 回到 4.6 和 4.8。
- GPT 6 Astra:越来越多用户回退到 5.6(sol 和 luna 均有报告),主要原因是作为主力模型太贵、性能不稳定。
@alexisgallagher 补充自己的判断:模型确实在变强,但变强速度赶不上用户对它们的要求增速。随着一个模型生成的代码越来越多,下一款模型需要驾驭更大代码库的全局架构问题、并行处理多任务——这正是 Kun 等人聚焦 chief-of-staff 模式、poteto 等人把架构不变量嵌入仓库并蒸馏更高级软件开发能力的原因。也有人猜测感知增速放缓与过度 RL 有关。
「模型」频道最新
- Codex 质量问题已修复,补偿性重置额度正全量推送 — CtrlAltDwayne · 2026-09-12
- Codex 用量重置机制曝光:9 月 12 日 07:00 UTC 上线,尚未确认执行 — DevDminGod · 2026-09-12
- Qwen3.8-27B 上线 Cerebras,AAII 得分 34 比肩 GPT-5.6 Luna — Alibaba_Qwen · 2026-09-12
- antirez 上传 DeepSeek V4.1 Flash GGUF 量化版到 Hugging Face — Queasy_Asparagus69 · 2026-09-12
- Qwen3.8-Max 在 OpenRouter 得分骤降,作者怀疑 effort 参数未被正确传递 — PawelHuryn · 2026-09-12
- Pipecat v1.9 发布:接入 Meta 流式语音转写模型 Muse,语义错词率最低 — solyarisoftware · 2026-09-12