LLM 当评委盲区扩大:奖励模型偏好正在毁掉写作评测

sam_paech · x · 2026-09-07

sampaech 回应「创意写作基准还能不能信」的疑问:所有由 LLM 评判的写作评测都应打折扣看待,最好直接阅读样本自行判断。

核心问题是,LLM 评委对「为讨好奖励模型偏好而优化」带来的可读性退化视而不见,而这一污染正日益严重。

所属事件:EQ-Bench 作者横评新模型创意写作:Muse Spark 1.3 最听话(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →