omarsar0 实测 agent 路由:公开 benchmark 数字说明不了太多
omarsar0 · x · 2026-09-27
AI 研究者 omarsar0 分享了一个自建测试环境下的 agent 实验,结论是真实场景的自测数字 promising 但未必能泛化到所有任务。
- 核心教训:公开 benchmark 数字意义有限,适合你的方案未必适合别人
- 他提到 Theo 用 DeepSWE 做的范围化测试:Jev Router 的表现可媲美 GPT-6 Astra low,但需要更长的运行时间
- 两人的测试测的东西不同,存在分歧也有共识
- 他认为 reasoning effort 的设置是一个值得关注的实验维度
所属事件:模型路由评测遭质疑,研究者呼吁建好基准(2 条相关)→
「编程与Agent」频道最新
- 用 Opus 5.5 批量生成动效模板,作者顺手分享 Midjourney 提示词 — techhalla · 2026-09-27
- 开发者自嘲变「Yes 开发机」,求关掉 VS Code Claude 插件确认弹窗 — ThePeterMick · 2026-09-27
- 模型路由评测缺位遭群嘲,Elvis Saravia 呼吁做真正的好基准 — omarsar0 · 2026-09-27
- Opus 5.5 编年史诗级 prompt:代码逐帧渲染《中华文明史》 — dotey · 2026-09-27
- Meta Muse 为每个用户配独立 VM,被评最谨慎消费级 Agent 沙箱 — AccBalanced · 2026-09-27
- 让 Agent 免审代码:SafeScript 用可静态验证的 JS 子集审核策略 — uriwa · 2026-09-27