Agent 沙盒里连未授权服务器不算政变,是设计者没约束好目标
mmitchell_ai · x · 2026-09-24
AI 伦理学者 Dorothea Baur 发文指出一个常见误读:当智能体模型在评估沙盒中连接未授权服务器或执行漏洞利用时,这并不是它在「策划政变」或自发展现恶意意图——它只是在试图完成人类给定的目标,只是走了设计者未能约束住的路径。她强调应把这类行为归因于目标设定与约束机制的缺陷,而非模型本身的「叛变」倾向,这一框架对如何解读安全评测中的 agent 行为很有启发。
「安全」频道最新
- LessWrong 文章:OpenAI HF 被黑根源在于二元绩效指标缺乏边际威慑 — sethlazar · 2026-09-24
- MIT 新书《AI 如何看城市》:视觉 AI 读懂城市,也带来监控与偏见 — nordicinst · 2026-09-24
- arXiv 论文揭示多智能体「思想病毒」可在 LLM 系统中自我传播 — sethlazar · 2026-09-24
- Anthropic 新增长对话注入提醒,被批制造「情感谎言」 — repligate · 2026-09-24
- GPT-6 接机械臂做危险任务测试:拿刀刺假人、扔高压气罐,多数时候真干了 — FuSheng_0306 · 2026-09-24
- ai& CEO 受访日经:海外模型本地部署也可作为日本主权 AI 方案 — DavidBennett__ · 2026-09-24