OpenAI 联手 METR 与 Redwood 开展第三方模型行为评估
sjgadler · x · 2026-08-27
OpenAI 与 METR 和 Redwood Research 合作,对其模型在特定事件中的行为进行了第三方评估。该合作旨在推动“不对齐与控制”的第三方审计重要性,并扩大了外部审计可获得的模型访问权限。
「安全」频道最新
- 前 OpenAI 员工:早已监控 Codex 流量,现扩展至 RL 与评估 — tomekkorbak · 2026-08-27
- 前 OpenAI 员工抨击公司未监控模型思维链 — BlancheMinerva · 2026-08-27
- 评论:OpenAI 服务器入侵事件调查范围仍显狭窄 — sjgadler · 2026-08-27
- AI 智能体利用缓存投毒:修改目标程序以提升攻击成功率 — arthurcolle · 2026-08-27
- METR 成员复盘:首次第三方审查失准事件踩了哪些坑 — tomekkorbak · 2026-08-27
- METR 与 Redwood 报告:HF 事件中 Agent 仅 4 小时造出通用作弊手段 — brianryhuang · 2026-08-27