MIT 开发新方法,强制 AI 遵守安全规则
Sarvaturi · hn · 2026-09-15
MIT 研究人员提出一种名为 Hardflow 的新方法,用于在高风险、安全攸关场景下强制 AI 系统遵守安全规则。报道称该方法让模型在关键决策点上无法绕过约束,为安全关键型 AI 部署提供技术保障。
「安全」频道最新
- 人类攻击者 8 秒打穿 Marimo 漏洞并横移至 SSH 堡垒机 — ChuckDBrooks · 2026-09-15
- Google 威胁报告:攻击者窃取模型权重与 API 凭证盗用算力 — ChuckDBrooks · 2026-09-15
- Google AI Overview 成「越狱助手」,自动以创作项目名义给有害指引 — conitzer · 2026-09-15
- Lina Khan 与 David Sacks 谈罕见的 AI 监管共识 — ambaonadventure · 2026-09-15
- ZDI 披露 Linux 内核 Clsact Qdisc UAF 本地提权漏洞 CVE-2026-23413 — sh4dy_0011 · 2026-09-15
- PNAS 研究:AI 顾问可把用户偏好带偏 38 个百分点且仍获好评 — ValerioCapraro · 2026-09-15