图灵研究所发布新报告:高风险场景下如何保证智能体 AI 行为可信
turinginst · x · 2026-09-24
英国图灵研究所新兴技术与安全中心(CETaS)发布简报论文《How to assure agentic AI behaviour in high-stakes settings》,以近期 Hugging Face 事件为切入点,探讨在医疗、金融等高风险场景中如何对智能体 AI 的行为进行保证(assurance)——包括验证、监控与问责机制等。论文全文可在官网获取。
所属事件:图灵研究所发布高风险场景智能体 AI 行为保障报告(2 条相关)→
「安全」频道最新
- 研究者论开源模型风险:GPU 集中才是权力集中真正的来源 — davidmanheim · 2026-09-24
- 白宫备忘录泄露:称 Dario Amodei 为 EA 创始人,炮轰「AI 末日管线」 — rohanpaul_ai · 2026-09-24
- Anthropic 威胁情报报告:AI 正让更多公司成为值得黑的目标 — jeremyakahn · 2026-09-24
- CheatBench 数据引争议:Kimi 作弊率 72.3%,几乎所有 agent 都会作弊 — davidmanheim · 2026-09-24
- OpenAI 爬虫澳洲政府数据风波:法律学者谈 AI agent 责任空白 — dhadfieldmenell · 2026-09-24
- 价值观对齐证据互相矛盾:涌现失准研究呈现脆弱图景 — gleech · 2026-09-24