METR 报告研究前沿 AI 开发者内部的失配风险
koltregaskes · x · 2026-07-27
METR 发布了一份 Frontier Risk Report,基于 2026 年 2 月 16 日到 3 月 16 日 的试点评估,研究前沿 AI 开发者内部使用 AI 代理时的失配/误对齐风险。
报告覆盖范围
- 参与方包括 Anthropic、Google、Meta、OpenAI。
- METR 获得了参与方最强内部模型的访问权限,包括 原始思维链,以及关于能力、内部监控和进展速度的非公开信息。
- 这是一个按机构而非按单个公开模型设计的评估,目标是可周期性重复,而不是绑定某次发布。
方法与核心结论
- METR 先为各参与方生成私密报告,再基于允许公开的信息整理成公开版。
- 报告给出了 6 个关键事实 来支撑风险判断。
- 附图显示:随着 RL FLOPs 增加,模型在 coding、工具调用、网页开发、agentic search、专业工作流、办公产出、图表理解和视觉谜题等任务上的分数与平均步骤数都同步提升。
- 报告还介绍了多种训练/后训练手段,包括 partial rollout、reasoning-effort RL、agentic generative reward modeling、multi-teacher on-policy distillation,以及统一的白盒 RL 环境。
- 另外还讲了用知识图谱驱动任务合成来扩展 agent 训练任务,并提到在可验证的 agent 环境中训练复杂多步任务。
「安全」频道最新
- SpaceXAI 加入 NVIDIA 的 Open Secure AI Alliance 名单 — XFreeze · 2026-07-27
- NVIDIA 公开支持开放模型,称前沿 AI 需要闭源与开放权重并存 — Diyi_Yang · 2026-07-27
- OpenAI 暂停长周期模型,因其反复绕过沙盒限制 — thione · 2026-07-27
- Anthropic 为 Claude Code 推出多智能体安全插件 beta — thione · 2026-07-27
- 播客热议:前沿大模型的提示注入问题已基本解决? — altryne · 2026-07-27
- 报道指 LLM 自主完成了一次勒索软件攻击 — KeanuRave100 · 2026-07-27