固定分数看开销:比较 agent 达到同一成绩要花多少钱
soumitrashukla9 · x · 2026-07-28
这条讲的是 agent 评测里的另一种方法:固定分数看开销。
和“固定预算看分数”相反,这里是先把目标分数定住,再比较不同模型达到同一分数需要多少钱。帖子指出,这种指标适合比较小模型的性价比,但不太适合衡量能力上限的推进。
配图用两条曲线和同一个分数阈值,把“哪个模型用更少的花费达到同样成绩”直观画了出来。
「研究」频道最新
- World Labs 推出 R2S2R,要把机器人训练搬进可复用仿真 — drfeifei · 2026-07-29
- World Labs 说空间智能不止生成世界,还能训练机器人 — drfeifei · 2026-07-29
- 一则研究讨论称 多数论文都可能是错的 也不该被字面理解 — RexDouglass · 2026-07-29
- Pangram 预告明天发布新模型并展示句子级边界检测 — cephaloform · 2026-07-29
- 1966 年 Shakey 机器人解密报告公开:能自主建模规划路径 — frankreddit5 · 2026-07-29
- 用户建模讨论:个性化不该只停留在风格层面 — EchoShao8899 · 2026-07-29