重度用户观察:Claude Sonnet 近两周在 Claude Code 中表现悄然变好
DevJedis · reddit · 2026-09-14
一位长期使用 Sonnet 的用户反映,最近约两周 Sonnet 在 Claude Code 里的表现明显变好,原本需要切换到 Opus 才能完成的任务现在 Sonnet 也能胜任。他注意到会话中反馈提交(feedback submission)请求变多,怀疑 Anthropic 在进行 A/B 测试。作者强调这与近期的用量额度调整无关,只是对模型行为的独立观察。
「模型」频道最新
- 同样是 $20 ChatGPT,为何有人没有 5 小时限制? — noletovictor · 2026-09-14
- Agnes 2.5 Pro Beta 对比 GPT-5.6 Sol:同题 3D 模拟成本 $0.20 vs $1.70 — iamaliveix · 2026-09-14
- Gary Marcus 批 GPT-6 Astra:进步昂贵难出基准,救不了 OpenAI 经济困局 — GaryMarcus · 2026-09-14
- DeepSeek V4.1 Flash 将 KV cache 压到每 token 890 字节 — Prompt Engineering · 2026-09-14
- IndyDevDan 用 5 个基准给 GPT-6 Astra 与 Fable 5.1 排名 — IndyDevDan · 2026-09-14
- 开发者实测 Mercury 2.5:约 13 秒读完病历并纠出 3 处错误 — MaziyarPanahi · 2026-09-14