研究者提醒:LLM 评审的写作评测存在系统性盲区

koltregaskes · x · 2026-09-07

sampaech 在回复中提出,看待任何由 LLM 评审打分的写作评测都应保持谨慎:最好亲自阅读样文、自行判断。他指出,当模型针对奖励模型偏好做优化时,会产生可读性问题,而 LLM 评审对这类问题相当不敏感——这正是一个日益严重的现象。原帖作者对此表示认同。

所属事件:EQ-Bench 作者横评新模型创意写作:Muse Spark 1.3 最听话(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →