实验发现:更强模型写出的自动评测确实更靠谱

danshipper · x · 2026-10-08

作者正在实验自动化评测(automated evals),验证一个直觉问题:给 LLM judge 更多算力是否等于更好的检查?结论是基本成立——更聪明的模型写出的评测质量更高,且提高推理 effort 对小模型(如 Luna)的评测效果提升尤其明显。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →