模型品味不随能力提升:Sonnet 3.6 品味好于 Opus 5.5
Sauers_ · x · 2026-10-10
作者 Sauers 观察到,模型的「品味」(taste)并不会随能力提升而改善,且各模型差异明显:Claude Sonnet 3.6 品味相当不错,而 Opus 5.5 的技术品味只能算平庸偏好。
他进一步指出,任何试图以可验证方式量化「品味」的评测,很可能只是在间接测量模型能力本身,而非独立的品味维度。
「模型」频道最新
- OpenAI 推 GPT-6 Sol/Luna:ChatGPT 智能界面实时生成可视化 — aidan_mclau · 2026-10-10
- Agent Arena 弃用偏好投票,用真实任务五信号评测智能体 — arena · 2026-10-10
- OpenAI 研究员:新模型更诚实,但评测觉察威胁安全测量 — ericmitchellai · 2026-10-10
- 爆料称 Google 或已突破递归自我改进,三大实验室逼近 RSI — imjustnewatai · 2026-10-10
- 把「数学家」换成「医生」:AI 圈群嘲大模型数学论断的傲慢 — NachoSoto · 2026-10-10
- 用户称已逼近 Grok 每周用量上限,呼吁 xAI 翻倍额度 — nima_owji · 2026-10-10