LLM 评委对不上人类口味,作者猜这正是风格短板难修的原因

maxsloef · x · 2026-09-27

maxsloef 表示他做 Namedrop 评测就是希望实验室能据此 hillclimb 优化模型,但他无法构建出符合自己品味的自动评分器:尝试了多种模型、提示词和页面呈现方式后,LLM 评委始终与他的判断分歧。他推测,这或许正是风格引导问题至今未被修复的原因——模型风格能力难以自动评测,实验室也就难以针对性优化。

所属事件:博主三天 1.5 小时完成 Namedrop 模型评测(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →