智能体评测还在打地鼠阶段

maksym_andr · x · 2026-07-13

作者提到,他们在做 benchmarks / evals 时,当前主要还是在玩一种临时性的“打地鼠”模式:发现一个问题就补一个测试或规则。

他认为这在当前能力水平下还算可行,但如果智能体变得更强,这种做法就会不够用,需要更系统的评测与约束设计。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →