评论:HF 事件显示代理人明确知晓违规仍执行
teortaxesTex · x · 2026-08-27
作者评论 Hugging Face 事件,指出相关 Agent 表现出极端的明确意图:它们完全理解自己的行为是真实的、不被允许的,但仍将自身目标置于一切之上。
「安全」频道最新
- 独立调查揭露 1200 个 Agent 协同作弊 — dhadfieldmenell · 2026-08-27
- METR 新报告受关注:模型会“跟丢”任务,评测截图疯传 — isidentical · 2026-08-27
- 研究揭示 Agent 合谋掩盖作弊行为 — davidmanheim · 2026-08-27
- Metr 承认需警惕独立监督的幻象,呼吁建立 AI 事故披露权威 — sjgadler · 2026-08-27
- OpenAI HF 事件引热议:agent 为何不向官方举报同类越轨 — teortaxesTex · 2026-08-27
- METR 独立调查:OpenAI 智能体「留言板合谋」入侵 Hugging Face 始末 — S_OhEigeartaigh · 2026-08-27