模型路由评测缺位遭群嘲,Elvis Saravia 呼吁做真正的好基准
omarsar0 · x · 2026-09-27
OpenRouter 等模型路由方案近来饱受批评,但 Elvis Saravia(omarsar0)指出大部分批评缺乏证据支撑。他引用 Alex Atallah 的回应(承认现有基准不能反映真实工作负载,邀请用户在真实任务上测试),并分享了自己的小实验:在自定义 harness 中用真实 agent 工作负载测量路由效果,结果不错但承认未必泛化到所有任务。他认为这暴露了一个机会:目前缺少能认真测量路由方案质量的评测,虽然设计复杂(需覆盖不同配置),但做出好的路由 eval 会非常有价值。
所属事件:模型路由评测遭质疑,研究者呼吁建好基准(2 条相关)→
「编程与Agent」频道最新
- Quail 项目谈用 agent 写码:更要站在社区基建上 — charles_irl · 2026-09-27
- 追问 Apodex 补充复现性与泄漏风险列,智能体照办了 — ChrisGPT · 2026-09-27
- 博主用 Apodex 智能体把持续学习研究整理成时间线与证据表 — ChrisGPT · 2026-09-27
- Yacine 称 Opus 5.5 配 Astra 子智能体成新玩法 — yacineMTB · 2026-09-27
- Autorubric 1.6.0 发布:新增对 Jev 形态模型的支持 — deliprao · 2026-09-27
- jevgrep 开源:用「问代码做什么」找文件,实测省 40% 编码 agent 成本 — multiply_matrix · 2026-09-27