Opus 5 写作质量退步获基准测试证实
gleech · x · 2026-08-27
观察显示 Opus 5 的写作质量似乎变差了。数据证实了这一点:在弱自动基准和两个人类评分的写作基准上均出现退步。不过最新修正显示,Opus 5 在 Hemingway-Bench 上扭转了趋势,且大部分退步随后会以随机游走方式自我逆转。
「模型」频道最新
- 「便宜中国模型威胁前沿实验室」是劳动力固化谬误?引争论 — robleclerc · 2026-08-27
- 安全学者警示:OpenAI 炒作模型「持久性」,或非安全特征 — DavidSKrueger · 2026-08-27
- 让模型更保守竟导致误判率上升?Prompt 工程陷阱 — CupGlass540 · 2026-08-27
- 口述转 Claude 格式化,产出仍被判 100% AI — threepointone · 2026-08-27
- Mollick 警告:别把人格投射进 METR 报告的 agent — emollick · 2026-08-27
- Zai 开源 320B 模型 GLM-5.3-Flash,原生多模态且全在华芯运行 — ccerrato147 · 2026-08-27