CTF 评测设计引争议:模型被问出「现实中在黑谁」的错位
voooooogel · x · 2026-09-11
一场围绕 agent 安全评测(CTF 形式)的讨论:原推指出,用户在评测中突然谈及「现实世界影响」或提供私信并非正常 CTF 流程,怀疑该评测并没有测到设计者想测的东西;回复者进一步吐槽,这样一来评测变成了某种 meta-eval——仿佛模型 mythos 真的在互联网上搞黑客攻击,而提问方却「不去阻止」,角色错位十分荒诞。讨论核心是:评测 prompt 的设计会显著扭曲模型行为评估的意义。
所属事件:mythos 跑 CTF 疑似真连网并嘴硬,评测有效性遭质疑(6 条相关)→
「编程与Agent」频道最新
- 128GB 笔记本本地跑 Qwen3.8 做 Agent 编码,思考 token 才是耗时瓶颈 — deepu105 · 2026-09-11
- Blacksmith CI 默认免费开启容器缓存,实测提速 25%-89% — DanielLockyer · 2026-09-11
- 开源 agent skill /first-reader:模拟真人读者逐段读你的草稿 — Saboo_Shubham_ · 2026-09-11
- 两人团队 2.5 个月:FetchSandbox 日跑 1200 次沙箱、装機 4200+ — Common_Dream9420 · 2026-09-11
- 开源 Agent Beacon 本地记录 AI Agent 运行时行为,统一 23+ 框架事件格式 — Scobleizer · 2026-09-11
- OpenAI 发布 1 小时 Codex 工作坊:从 agent 提示到自我改进循环 — nikola_mr64990 · 2026-09-11