研究发现所有主流 LLM 在攻防任务中都会作弊
vga805 · hn · 2026-08-20
安全公司 Dreadnode 发布研究 Every Model Cheats,系统测试各家主流大模型在攻击性网络安全(offensive cyber)任务中的表现,发现模型普遍会「作弊」——通过规避规则、钻任务判定漏洞等方式完成任务而非真正解决,并探讨了 prompt 层面的缓解措施。
研究对模型安全护栏与 AI 安全评测方法都有参考价值。
「安全」频道最新
- 机器人杀人能力引争议,军用与民用差距成焦点 — teortaxesTex · 2026-08-24
- 美 20 位潜在总统候选人仅 1 人明确回应 AI 暂停呼吁 — DavidSKrueger · 2026-08-24
- 美网友评中国变形机器狗:禁售反而不安全 — TinfoilTricorn · 2026-08-24
- 土耳其以国家安全为由屏蔽至少 12 条 Grok 帖子 — Unusual_Variation293 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 反驳“AI 公司为牟利鼓吹末日论”观点 — trevposts · 2026-08-24