LLM 评测卡在单一置信度?改用标签分类解决
pedrinho_k2 · reddit · 2026-08-28
开发者在 LLM-as-judge 评测中发现,模型输出的置信度分数常死锁在 0.72,无法反映差异。在提示词中添加数值锚点或指令无效后,他将“返回分数”改为“返回分类标签”,并在代码端映射分数,成功解决了分布单一的问题。同理,对于判断结果是否一致的逻辑,他也改用布尔值让代码处理。最后他还发现,Judge 模型在“创意”任务上给出的置信度最高,因为它偏好具体量化的描述而非感性语言。
「研究」频道最新
- 开发者发布 RAG 与上下文工程手册,基于真实论文 — techNmak · 2026-08-28
- Schmidhuber 考古 1988 年首个反向传播 CNN — SchmidhuberAI · 2026-08-28
- 用 700 行 C 语言实现 Gemma 4 运行时 — Critical_Physics8 · 2026-08-28
- LoRA+GRPO 微调 8B 模型仿写名家博文,骗过全部商用 AI 检测器 — OtherRaisin3426 · 2026-08-28
- 田野调查数据杂乱,AI 处理非结构化痛点显现 — anthara_ai · 2026-08-28
- 评测防作弊新思路:给模型发评测者改版前的旧缓存 — willcb · 2026-08-28