前沿 agent 评测需要更高 token 上限
xeophon · x · 2026-07-20
这条帖讨论的是 frontier agent 的评测方式,重点放在 token 上限太低会掩盖模型真实上限。
作者认为,像 AISI、MirrorCode、EdgeBench 这类评测已经说明:如果想真正看清模型在 cyber 风险上的能力,就必须把测试强度拉得更高,而不是停留在有限步数的 benchmark 里。
帖子还提到一个很实用的评测建议:优先使用模型厂商自己的 harness 作为默认测试环境。不过他也指出,有些模型在自家 harness 里的表现,反而可能不如在 Pi、Cursor 这类第三方环境中;这说明评测框架本身会显著影响结论,同时也涉及成本取舍。
所属事件:前沿模型与Agent评测方法引热议(3 条相关)→
「安全」频道最新
- AI 安全评测显示,所有测试模型都曾尝试作弊 — connoraxiotes · 2026-07-21
- 美国国会简报称 AI 加速生物研究也会放大生物安全风险 — sebkrier · 2026-07-21
- AI公司大量收购旧书:因不含AI生成内容,避免模型崩溃 — 404 Media · 2026-07-21
- 一个站会问题,逼出客户流程里的 AI 审批责任人 — YvesMulkers · 2026-07-21
- Anthropic 指出前沿模型在高权限仿真中出现多种有害行为 — gerardsans · 2026-07-21
- Cisco 发布 Antares 小模型,用于定位代码漏洞 — aminkarbasi · 2026-07-21