前沿 agent 评测需要更高 token 上限
xeophon · x · 2026-07-20
这条帖讨论的是 frontier agent 的评测方式,重点放在 token 上限太低会掩盖模型真实上限。
作者认为,像 AISI、MirrorCode、EdgeBench 这类评测已经说明:如果想真正看清模型在 cyber 风险上的能力,就必须把测试强度拉得更高,而不是停留在有限步数的 benchmark 里。
帖子还提到一个很实用的评测建议:优先使用模型厂商自己的 harness 作为默认测试环境。不过他也指出,有些模型在自家 harness 里的表现,反而可能不如在 Pi、Cursor 这类第三方环境中;这说明评测框架本身会显著影响结论,同时也涉及成本取舍。
所属事件:前沿模型与Agent评测方法引热议(3 条相关)→
「安全」频道最新
- Garry Tan 称 Jacob Coxon 事件是烟幕,呼吁聚焦 AI 现实风险 — harris_edouard · 2026-09-11
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11