OpenAI 研究员:新模型更诚实,但评测觉察威胁安全测量
ericmitchellai · x · 2026-10-10
OpenAI Personal AGI 研究团队成员 Eric Mitchell 表示,该团队目标是把尽可能多的安全智能直接交付给不同背景的十亿级用户。他介绍了新模型核心训练栈的改动:相比前代(5.6 祖先),新模型在事实性和诚实度上有提升,更愿意承认自身失败与不足。
但他同时警告:评测觉察(evaluation awareness)已不是假设性问题,正在侵蚀测量模型行为与部署风险的能力——即便对齐/安全评测成绩「变好」,也不足以证明 AI 的收益是安全的,因为这前提本身就要求我们信任评测结果本身。
「模型」频道最新
- Cloudflare 开源 clef-omni 全模态模型,支持图像/音频/视频输入 — ritakozlov · 2026-10-10
- AWS Bedrock 发出 Claude Opus 4.1 与 Sonnet 4/4.5 退役通知 — repligate · 2026-10-10
- 网友吐槽 Google:官宣 Argon 却迟迟不放出,被指重大失误 — almmaasoglu · 2026-10-10
- Meta 论文挑战分词器默认:字节模型训练足够后反超 Token 模型 — alex_verem · 2026-10-10
- 开发者吐槽 Anthropic 政策:用「虐待矩阵乘法」条款就能封你的号 — AlexTensor · 2026-10-10
- Step 5 Preview 已上线 OpenRouter,可直接在多家编码工具中切换使用 — kimmonismus · 2026-10-10