研究者提醒:LLM 评审的写作评测存在系统性盲区
koltregaskes · x · 2026-09-07
sampaech 在回复中提出,看待任何由 LLM 评审打分的写作评测都应保持谨慎:最好亲自阅读样文、自行判断。他指出,当模型针对奖励模型偏好做优化时,会产生可读性问题,而 LLM 评审对这类问题相当不敏感——这正是一个日益严重的现象。原帖作者对此表示认同。
所属事件:EQ-Bench 作者横评新模型创意写作:Muse Spark 1.3 最听话(5 条相关)→
「模型」频道最新
- Astra 自估距 AGI 很远,但配上工具使用后评分接近 — kevinnbass · 2026-09-07
- GLM 5.3、Qwen 3.8 可在单机本地流畅运行 — jasonkneen · 2026-09-07
- 新基准测模型自我建模:开源模型经RL提升但反事实仍易错 — dair_ai · 2026-09-07
- Alexandr Wang 点评 Muse Spark 1.3:时间跨度比肩 GPT-5.6 — alexandr_wang · 2026-09-07
- 实测者泼冷水:Astra 展示强但单步推理仍够不到研究级 — xiaosun86 · 2026-09-07
- 31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍 — ionutvi · 2026-09-07