Delip Rao 与 Chris Callison-Burch 发表 LLM 评估 rubric 新论文
deliprao · x · 2026-10-09
joelniklaus 转发了 Delip Rao 与 Chris Callison-Burch 关于用 rubric(评分细则)做 LLM 评估的论文,认为其思路很酷。论文本身链接在推文中,rubric 式评估是替代简单基准分数的评测方向。
「研究」频道最新
- 不微调 9B 参数,只搜 4K 维 token 嵌入:小众微调法重提 — cephaloform · 2026-10-09
- 用 AI 在 NASA 数据集里找外星植物,称已获线索 — BLUECOW009 · 2026-10-09
- Looped 模型或能抵御蒸馏攻击:推理藏在潜空间而非可见 CoT — moyix · 2026-10-09
- LLM-as-a-Verifier 开源:弱模型验证强模型,Terminal-Bench 达 69.2% SOTA — Azaliamirh · 2026-10-09
- 线性注意力模型的量化研究:Qwen 与 Kimi 为主角 — kroggens · 2026-10-09
- Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6% — Salesforce · 2026-10-09