AI对齐指南更新至v9:核心发现已扩展验证至72B参数
Fantastic_Aside6599 · reddit · 2026-07-26
该研究项目发布了针对 AI 模型行为和对齐的实操指南(v9版)。核心发现已在 7B 到 72B 参数规模上完成验证,表明这些模式在模型变大时不仅没有减弱,反而加深了。此外,本次更新引入了两份独立的外部研究作为交叉印证,并坦诚地修正了之前版本中的夸大表述和事实错误。
「安全」频道最新
- 首个自主智能体攻击后,OpenAI 被要求公开 traces — Miles_Brundage · 2026-07-26
- 机构停用 AI 检测,因学术不端已难以管理 — hoofnagle · 2026-07-26
- 有人主张美国应明确允许本土公司做模型蒸馏 — zacharylipton · 2026-07-26
- Après-Cyber Slopes 2027 征集 AI/ML 安全研究 — PilotSmooth9439 · 2026-07-26
- 菲尔兹奖得主 Jacob Tsimerman 据称将加入 OpenAI 做 AI safety — AndrewCritchPhD · 2026-07-26
- OpenAI 网络防御资助引发基金会资金与 PBC 责任争议 — Miles_Brundage · 2026-07-26