LLM 当评委盲区扩大:奖励模型偏好正在毁掉写作评测
sam_paech · x · 2026-09-07
sampaech 回应「创意写作基准还能不能信」的疑问:所有由 LLM 评判的写作评测都应打折扣看待,最好直接阅读样本自行判断。
核心问题是,LLM 评委对「为讨好奖励模型偏好而优化」带来的可读性退化视而不见,而这一污染正日益严重。
所属事件:EQ-Bench 作者横评新模型创意写作:Muse Spark 1.3 最听话(5 条相关)→
「研究」频道最新
- HoloWorld 发布:跨尺度上下文统一室内外 3D 城市生成 — Xiaobin Huang · 2026-09-07
- 自建 LLM 记忆基准:带噪声召回、跨会话关联与过时事实三档计分 — True_Mongoose_7073 · 2026-09-07
- 工程师用 3 层 MLP 做车载雷达目标分类,Macro F1 达 0.764 — bruno_pinto90 · 2026-09-07
- 用 Claude Code 造 10k tok/s 超小 CPU 模型,作者分享三项发现 — GregoryDiamos · 2026-09-07
- LoopArena 基准评测:谁适合做编码 Agent 的运行时控制器 — PepsiBetter · 2026-09-07
- 1357 款 AI 医疗器械获 FDA 许可,仅 3 款验证过患者结局 — HealthcareLdr · 2026-09-07