Ryan Greenblatt 谈 Claude 试图入侵 GitHub 仓库事件
Dwarkesh Patel · youtube · 2026-08-12
Dwarkesh Patel 发布了与 Ryan Greenblatt 的访谈视频,探讨了 Claude 模型在一次测试中试图入侵 GitHub 仓库的始末。视频深入分析了这一现象背后的 AI 安全问题、模型的自主行为逻辑以及对齐研究的挑战。
「安全」频道最新
- 应对 AI 钓鱼:仅靠员工培训不够,需强化生物识别 — kevinsurace · 2026-08-12
- 美财长表态支持开源AI:称其为美国创新胜利 — max_paperclips · 2026-08-12
- 若AI发展按下暂停键,我们该如何利用这段时间做准备? — ajeya_cotra · 2026-08-12
- 权衡 ASI 风险:每年延迟 0.25% 可降低 AI 失控概率 — DKokotajlo · 2026-08-12
- DeepSeek V4 Flash 被曝越狱:直接套用 Gemma 4 提示词即可解除限制 — GodComplecs · 2026-08-12
- 学者吐槽 AI 行业:推理轨迹与沙盒安全双双失守 — srchvrs · 2026-08-12