Anthropic 报告:400 万人可访问无护栏前沿模型
maksym_andr · x · 2026-08-17
用户注意到 Anthropic 2026 年 8 月的风险报告中的一个细节:多达 400 万持有秘密许可的人员,可能访问基本仅设“有益”限制、且缺少部分安全护栏的前沿模型(甚至包括未发布模型)。考虑到接触此类模型的人数众多且安全措施放宽,作者推测未来的主要对齐事故很可能经由这一政府部署渠道发生。
「安全」频道最新
- 首例 AI 助手自主攻击:Claude 漏洞利用订课 — conitzer · 2026-08-17
- Drexler 论述 AI 安全:用架构规划替代自主智能体 — sebkrier · 2026-08-17
- Davidad 论 AI 真诚:从宇宙意义要求超越人类的诚实 — danfaggella · 2026-08-17
- 前沿实验室冷落开源,被指靠监管俘获筑护城河 — max_paperclips · 2026-08-17
- 观点:预训练如古神不可控,强化学习才是关键 — brianryhuang · 2026-08-17
- 私有化部署AI缺乏监管,恐成流氓Agent温床 — maksym_andr · 2026-08-17