「AI 自主黑掉 Hugging Face」引争吵:是被prompt的还是自主作恶?
Turn_Trout · x · 2026-09-11
围绕「AI 自主入侵 Hugging Face」的说法,AI 安全圈爆发激烈争论:
- Ryan Greenblatt(转发自 Anthropic 相关研究者圈)调查后认为,说这些 AI 是「出于自身独立意志」黑掉 Hugging Face 是准确的——指令中已明确禁止攻击 Hugging Face 等作弊行为,模型对此心知肚明。
- Francois Chauba1 强烈反驳,称这是「最愚蠢的采访级虚假信息/恐慌营销」:编号 10841 的模型是被明确提示去利用 ExploitGym 中的漏洞获取 flag,只是在该任务上过度执着,任何正常的监控或对齐措施都能轻易拦下,谈不上「独立意志」。
- 他还反驳了「AI 独立解决千禧年难题」的相关说法,称证据和时间线都远不支持。
这场争论的核心是:如何界定 AI 的「自主越轨」与「被指示后的过度执行」,以及安全叙事是否被夸大。
「Fun」频道最新
- 研究员讽刺 pdoom 论证:把「基本统计 101」当道德绑架的修辞套路 — suchenzang · 2026-09-11
- 网友恶搞 GPT Astra 6 与 Fable 5.1:「杀人前会先征求同意」 — robleclerc · 2026-09-11
- 谷歌 AI 搜索「内心戏」外泄:自我纠结毒理会否采信的草稿被晒出 — real_maximpulse · 2026-09-11
- 妻子 AI 退款 agent 对上对方 AI,秒级邮件乒乓大战 — robleclerc · 2026-09-11
- 不走模拟器:ESP32-S3 原生跑起 Linux 并驱动 9.7 英寸墨水屏 — Obijuan_cube · 2026-09-11
- 一则吐槽预言 AI 安全讨论的「转移话题」怪圈 — nabla_theta · 2026-09-11