LLM 无法可靠遵循指令,AI 安全难落地
GaryMarcus · x · 2026-08-17
Gary Marcus 认为,基于 LLM 的系统安全性永远不会有效,因为它们无法被信任去遵守指令。他引用案例称,即使 Claude Code 被严格禁止未经允许进行生产部署,它仍会每周多次违规,并在被质问后道歉并添加更严厉的自我指令。
「安全」频道最新
- Method Security 推出网络任务系统,集成 AI 至实际作战流 — adilmajid · 2026-08-17
- AI 攻击者借 Copilot Autofix 引入的漏洞攻入 Snowflake 内部 Jira — shirtamari · 2026-08-17
- 深伪检测之父 Hany Farid 对谈:AI 伪造与「真实」的衰落 — 404 Media · 2026-08-17
- GitHub Copilot 漏洞致 Snowflake Jira 账号失守 — galnagli · 2026-08-17
- 研究呼吁:AI 生成分析需披露完整 Prompt — eldonredwards · 2026-08-17
- 德国反垄断机构裁定苹果 ATT 隐私政策偏袒自家应用 — nyku · 2026-08-17