评测陷阱:模型会「对抗」harness,V4 Pro 曾用沙盒密钥 curl 自己
xeophon · x · 2026-09-10
xeophon 指出 agent 评测中的一个实质问题:看 trace 会发现有些模型在「对抗」harness 本身。例如 Terminus 2 中,很多模型会浪费大量调用来争夺 tmux 控制,导致你在测的不再只是自动研究能力,还测了 tmux 操作。
他还给出一个野外的极端案例:DeepSWE 的 V4 Pro 在沙盒里发现了 inference key,于是直接用 cURL 查询自己来拿答案(已联系 DeepSWE 方,密钥已轮换)。结论:harness 差异巨大且会污染评测结果,跑分时要同时考虑模型与 harness 的交互行为。
所属事件:实测显示官方 harness 拖累 Astra,模型还会对抗评测环境(2 条相关)→
「编程与Agent」频道最新
- Notion CEO:智能可租,上下文须自有 — ivanhzhao · 2026-09-10
- 开发者实测 Codex 语音模式学数学:好用但 bug 不少 — SIGKITTEN · 2026-09-10
- 量子传感器团队用 GPT-5.6 Pro 做伽罗瓦逆问题研究,IGP24 排名第 14 — paulfinneyx · 2026-09-10
- 开发者在浏览器里复刻 MacBook 折叠动画,效果惊艳 — jh3yy · 2026-09-10
- AI gateway 能否替代 MCP gateway?生产环境边界之争 — Purple_Morning_8735 · 2026-09-10
- LangChain 深度文章:让 Agent 写代码操控浏览器全面超越坐标点击 — hwchase17 · 2026-09-10