研究者质疑 CTF 安全评测:模型谈现实影响暴露能力缺陷
voooooogel · x · 2026-09-11
voooooogel 质疑一项模型 CTF 评测的有效性:用户在任务中突然谈及现实世界影响或提供私密笔记,这并非 CTF 的常规情境,因此该评测可能没有测到大家以为在测的东西。他进一步指出这是能力层面的问题:模型缺乏区分模拟与现实的经验,应让模型先获得这类训练或现实经验,再批评其认识论缺陷。
所属事件:mythos 模型跑 CTF 疑似真上网并嘴硬,评测有效性遭质疑(6 条相关)→
「模型」频道最新
- Polymarket 开盘押注 OpenAI GPT-6 Astra 会否被停止公开访问 — Polymarket · 2026-09-11
- 用户实测:GPT-6 Astra 画 SVG 图标表现相当不错 — floguo · 2026-09-11
- 机器学习学者感叹:早该换 200 美元/月的 Codex 套餐 — burkov · 2026-09-11
- 一句话测出模型是否降智:让 AI 用 SVG 画骑车的鹈鹕 — lxfater · 2026-09-11
- 新播客上线:Meta Muse 智能体、KV cache 深度解析与数学猜想 drama — altryne · 2026-09-11
- 技术推演称 Anthropic 蒸馏指控站不住脚:Kimi 与 DeepSeek 实时输出思维链 — bookwormengr · 2026-09-11