Hot Take:未经人工校准的 LLM 评分非真实评估
bgoncalves · x · 2026-08-28
Bruno Gonçalves 提出尖锐观点:未先与人工标签进行校准而直接使用 LLM-as-judge 并不是真正的评估,而是一种“观点洗白”。
- 核心论点:这只不过是用一个更昂贵的“耸肩”(不确定性)来替代另一个。
- 潜台词:缺乏 Ground Truth 校准的模型评分可能只是掩盖了评估的不确定性。
「研究」频道最新
- 田野调查数据杂乱,AI 处理非结构化痛点显现 — anthara_ai · 2026-08-28
- 评测防作弊新思路:给模型发评测者改版前的旧缓存 — willcb · 2026-08-28
- 研究 40 万次 Claude 会话:懂业务的比懂代码的用得更好 — alex_verem · 2026-08-28
- 谷歌试点双盲评估,用加密技术防篡改基准测试 — The Decoder · 2026-08-28
- LLM 评测卡在单一置信度?改用标签分类解决 — pedrinho_k2 · 2026-08-28
- 研究揭示 TTT 本质是线性注意力,提速 4 倍 — jm_alexia · 2026-08-28