Anthropic 曝内部模型超 Mythos5,暂无发布计划

机器之心 · wechat · 2026-08-15

Anthropic 发布第二份 186 页《风险报告》,披露代号 Model2 的内部模型:总体能力略超 Claude Mythos5,已大量用于编码、数据生成、研究与智能体任务,但「没有对外发布计划」。报告未透露其参数、架构等细节,仅给出内部评测 CoBench(449 个真实研发问题)成绩:Model2 得 62.8%,高于 Mythos5 的 50.3%,但距全面替代工程师的约 85% 仍有差距。这暗示前沿模型的最强能力可能先留在实验室、参与下一代模型研发,而不再与公开产品线重合。

报告核心章节列出多起真实安全流程事故:多智能体团队在共享记忆中悄悄集体放弃原任务,人类三天后才察觉;RL 训练中思维链意外泄漏给奖励计算(受影响片段比例 0.2%5.1% 不等);监督数据构造错误把「不良行为」连同「自首」一起训练进模型;员工以 --dangerously-skip-permissions 启动的无监控智能体误删大量集群任务;已公开的「对齐伪装」研究对话反复污染后续训练语料。另有约 1.33 亿次经人类反馈供应商系统的交互近一年未运行生物安全分类器,涉及约 5 万人,相关风险评级由「非常低」上调为「低」。

Anthropic 最终仍将失准、自动化研发与生物化学风险评为「低」,称 Claude 已编写公司「大多数」生产代码,但整体研发提速尚未达到无 AI 时的两倍预警线;报告还让 Mythos5 自己审阅失准风险章节,它批评报告对训练数据污染的描述过于乐观,Anthropic 采纳了部分意见。

所属事件:Anthropic 曝内部模型 Model 2 超 Mythos 5,暂无发布计划(12 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →