博主想拿 Clef 当 LLM 评委,结果发现大量坏掉的评分规则
xeophon · x · 2026-10-09
博主 xeophon 原本想用 Clef 做 LLM-as-judge 的基准测试,却在过程中发现了大量损坏的评分规则(rubrics),并附了截图。这一发现提示:评测工具本身的规则质量不可靠,用 AI 评委打分前得先审查 rubric 的有效性。
「模型」频道最新
- OpenAI 与 Claude 拒帮忙逆向工程,用户改用 Kimi 绕过限制 — doodlestein · 2026-10-09
- 曝 OpenAI 推出 GPT-6.1 Sol Ultrafast:8 倍速,输入 $12/百万 token — testingcatalog · 2026-10-09
- Artificial Analysis:输出 token 越多分越高?Claude 三款模型 20 万 token 仍垫底 — ArtificialAnlys · 2026-10-09
- 模型性价比帕累托前沿:GPT-6 Luna 每任务 0.22 美元,Claude 要 18-22 美元 — ArtificialAnlys · 2026-10-09
- 加幻觉门槛后 Grok 4.7 居首,超六成合格结果含实质幻觉 — ArtificialAnlys · 2026-10-09
- Signal65 实测:本地小模型 Agentic 能力追平 Claude Opus 5,参数少 13 倍 — ryanshrout · 2026-10-09