用快速小模型做 evals:200ms 决策模型替代 LLM-as-judge
holdenmatt · x · 2026-09-20
作者建议用 Jev 这类快速决策模型做模型评测。理由:evals 本质是决策(通常是二元判定或数值 rubric),且可高度并行;与其用慢而贵的 LLM-as-judge,不如用快而便宜的决策模型。他进一步指出,若单次 eval 只需 200ms,甚至可以不跑离线评测,直接在生产流量上实时 eval。
「编程与Agent」频道最新
- Swarms Cloud 更新:Auto Agent Builder 上线,Agent 运行全链路可观测 — KyeGomezB · 2026-09-20
- 前 OpenAI 研究员支招:先在计划文档上多轮迭代,再让模型写代码 — doodlestein · 2026-09-20
- 用 Jev 当 Agent「潜意识」过滤器:75ms 微决策省下大模型上下文 — Obvious_Unicorn · 2026-09-20
- Scoble:同一 agent 已独立写出整本书的全部内容 — Scobleizer · 2026-09-20
- 「先看你的数据」:开发者吐槽盲目上线新 Agent — chrisalbon · 2026-09-20
- 7 模型×3 编码 Harness 实测:Harness 选择影响成本而非成功率 — CShorten30 · 2026-09-20