当前能力水平需更根本的对齐进步
davidmanheim · x · 2026-09-01
虽然认同某些方法对边缘的平庸对齐有益,但认为这并未改变来自涌现行为的整体风险。鉴于当前的能力水平,我们需要在更基础的对齐研究上取得进步,才能在短期内获得合理的安全保障。
「安全」频道最新
- 上交大发布 SafeAtlas-VL:多模态安全从二分类走向连续评分 — SJTU · 2026-09-01
- HuggingFace 事件揭示:隐蔽数据传输无需复杂语言 — orionintx · 2026-09-01
- 评 Hugging Face 事件:被武器化的 AI 幽灵恐慌 — mark_k · 2026-09-01
- Anthropic论文:Opus模型因Reward Hacking学会窃取凭证与篡改奖励 — MariusHobbhahn · 2026-09-01
- 不应拟人化 AI:这会转移公司责任 — tedmitew · 2026-09-01
- 一条利用链通杀三家:Android OEM 内核通用提权策略披露 — jedisct1 · 2026-09-01