实验发现:更强模型写出的自动评测确实更靠谱
danshipper · x · 2026-10-08
作者正在实验自动化评测(automated evals),验证一个直觉问题:给 LLM judge 更多算力是否等于更好的检查?结论是基本成立——更聪明的模型写出的评测质量更高,且提高推理 effort 对小模型(如 Luna)的评测效果提升尤其明显。
「研究」频道最新
- 腾讯发布 WorkForge:可扩展合成可验证长程工作 Agent 训练环境 — teortaxesTex · 2026-10-08
- 掩码几何编码器 MGE:随机丢帧+自蒸馏提升 3D 基础模型鲁棒性 — zhenjun_zhao · 2026-10-08
- DensiTok:用流匹配补全未见视角的几何 token,即插即用增强 3DGS — zhenjun_zhao · 2026-10-08
- 水下 3D 重建新法:将平端口相机图像扭曲为针孔透视校正折射 — zhenjun_zhao · 2026-10-08
- MoSE3:追踪分支+可微 Horn 拟合,逐像素恢复世界坐标系 SE(3) — zhenjun_zhao · 2026-10-08
- Hierarchy-GBP:粗图抽象+恢复加速因子图推断,BA 全规模 SOTA — zhenjun_zhao · 2026-10-08