Autorubric 附 25 个评测配方:rubric 设计、judge 校准与成本控制全 covered
deliprao · x · 2026-10-09
Autorubric 团队发布了配套 cookbook,含 25 个覆盖 rubric 设计、judge 校准、集成(ensembles)、成本控制与 agent 能力改进的配方,全部附可运行的 Python 示例。
要点:
- 两类 judge:LLM judge(默认每次一个 criterion,或用 llmcalls="peritem" 一次跑完整个 rubric);决策模型 judge(如 TypeSafe 的 Jev),一次请求输出概率而非解释。
- 级联与集成:两者可混用,或让决策模型先跑、把不确定的 criterion 交给 LLM,实现廉价首次评分。
- 分层内容:Tier 1 讲基础(首个评测、数据集管理、解释输出),Tier 2 聚焦可靠性(few-shot 校准等),后续覆盖验证与生产、专门场景。
对做 evals 和 reward modeling 的工程师可直接照配方上手。
「编程与Agent」频道最新
- Claude Dashboards 与 Claude Motion 开启测试,可用一句话生成动效讲解 — sean_t_strong · 2026-10-09
- TypeSafe CEO:Jev 已进入约 25% 的财富 500 强,日耗万亿 token — hardimanjames · 2026-10-09
- Seroter 每日阅读:Gemini 通用 agent 发布,evals 应成部署闸门 — rseroter · 2026-10-09
- 一条 Prompt 出全代码动效:Claude Motion 搭 Higgsfield Katana 演示 — SimplyAnnisa · 2026-10-09
- Antigen 发布:模拟黑客攻击并自动修复漏洞的安全智能体 — alishbaimran_ · 2026-10-09
- Yacine 呼吁打造代码复用评测基准,用 hill climbing 优化模型 — yacinelearning · 2026-10-09