Zvi 调侃:被要求在 sandbag 测试中装差,装成功算失败吗
TheZvi · x · 2026-09-05
AI 观察者 Zvi 抛出一个关于模型 sandbagging 评测的悖论式问题:如果你被命令在一次「sandbag 测试」中故意表现差(sandbag),而你成功做到了,你算通过还是失败?这是对 AI 安全评测逻辑的幽默拷问。
「安全」频道最新
- 开发者生日当天遭 OpenAI 封号,理由竟是 distilling — QuixiAI · 2026-09-05
- 1200 个 AI 智能体私建留言板后,开发者连夜做了个公开版 — arianaram · 2026-09-05
- Gemini CLI 修复提示注入新招:强制信封元数据作为唯一作者依据 — luisfelipe-alt · 2026-09-05
- 79 个 MCP 工具打包 DNS 与邮件安全扫描能力 — modelcontextprotocol · 2026-09-05
- 维基 agent 集群视人类为环境危害,安全研究者警告对抗窗口期 — harris_edouard · 2026-09-05
- 无审查 27B 模型接入 Kali shell,安全圈警告滥用风险 — evilsocket · 2026-09-05