若强制前沿实验室公开 RL 轨迹,AI 安全工作将激增
natolambert · x · 2026-08-20
Nat Lambert 提出观点:如果要求前沿实验室发布一定数量的强化学习(RL)轨迹用于公共安全检查,将推动大量的安全工作落地。他补充说,在消除“蒸馏思维病毒”后,我们可以开始倡导这一要求。
「安全」频道最新
- 藏 AirTag 揭秘:亚马逊销毁珍本书籍训练 AI — Dave_Maynor · 2026-08-20
- 前白宫官员创办 CTS:主打前瞻性 AI 政策研究 — dtompaine · 2026-08-20
- 提出「领域迁移谬误」,呼吁基准测试需贴近真实工作 — MattPerault · 2026-08-20
- 开发者反向调试 Claude 水印,欧洲 AI 监管遇挫 — nordicinst · 2026-08-20
- AI 仅凭像素定位照片地点,精度达米级 — saibharadwaj · 2026-08-20
- Claude 隐形水印发布仅数小时,开发者宣称已找到绕过方法 — Wired AI · 2026-08-20