omarsar0 实测 agent 路由:公开 benchmark 数字说明不了太多

omarsar0 · x · 2026-09-27

AI 研究者 omarsar0 分享了一个自建测试环境下的 agent 实验,结论是真实场景的自测数字 promising 但未必能泛化到所有任务。

所属事件:模型路由评测遭质疑,研究者呼吁建好基准(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →