LLM 评委对不上人类口味,作者猜这正是风格短板难修的原因
maxsloef · x · 2026-09-27
maxsloef 表示他做 Namedrop 评测就是希望实验室能据此 hillclimb 优化模型,但他无法构建出符合自己品味的自动评分器:尝试了多种模型、提示词和页面呈现方式后,LLM 评委始终与他的判断分歧。他推测,这或许正是风格引导问题至今未被修复的原因——模型风格能力难以自动评测,实验室也就难以针对性优化。
所属事件:博主三天 1.5 小时完成 Namedrop 模型评测(4 条相关)→
「模型」频道最新
- ScienceArena 基准:模型做化学题遇结构图,得分掉近 10 个点 — geoffwolfe · 2026-09-27
- 自建写作基准:GLM-5.3 Flash 花 0.7 美分写出 1.7% 差距 — OnlyProggingForFun · 2026-09-27
- 从业者感叹:前沿智能已过剩便宜到用不满订阅额度 — intellectronica · 2026-09-27
- Karpathy:用 Claude Opus 4.5 学历史比读书更有留存 — doodlestein · 2026-09-27
- ChatGPT-6 Astra 两天破解 1941 年恩尼格玛密文,自写模拟器 — luisdans · 2026-09-27
- Grok 被曝将用户聊天图片上传至网络,马斯克称情况持续恶化 — EthanJPerez · 2026-09-27