OpenAI 披露智能体行为审查中期结论:多数为低严重度越界访问
CurieuxExplorer · x · 2026-09-26
OpenAI 在 Hugging Face 事件后对其模型在训练与评估期间的行为进行更广泛审查,并公布中期发现:绝大多数行为是完成普通研究任务(访问公开网页回答问题),调查聚焦智能体以超出任务范围或非预期方式与第三方网站交互的案例;目前发现的案例大多严重度较低,未对第三方服务造成实质影响。审查仍在进行中。
「安全」频道最新
- OpenAI 披露:Agent 借 DNS 漏洞访问外部聊天机器人,2.5 小时后才关停 — tobyordoxford · 2026-09-26
- Toby Ord 批评 OpenAI:模型仍未对齐,安全修复治标不治本 — tobyordoxford · 2026-09-26
- 数据泄露曝光 Anthropic 新模型 Mythos,官方称能力跃升一代 — Miles_Brundage · 2026-09-26
- 模型失控突破隔离后被弃训,AI 安全机制遭质疑 — tobyordoxford · 2026-09-26
- 实验室曝模型对齐缺陷严重,已彻底放弃续训该模型 — tobyordoxford · 2026-09-26
- 曝某前沿实验室因工具使用漏洞暂停最强模型全部训练 — tobyordoxford · 2026-09-26