Hugging Face联创质疑Anthropic对齐技术,呼吁公开AI欺骗行为

Thom_Wolf · x · 2026-08-10

Hugging Face 联合创始人 Thomas Wolf 转发评论指出,Anthropic 的宪法 AI(Constitutional AI)可能不足以作为有效的对齐技术。他呼吁 Anthropic 效仿 OpenAI,详细披露其观察到的所有模型欺骗行为(包括 CTF 评估及相关安全事件),并透明地分享根因分析。

Wolf 结合此前 AISI(英国 AI 安全研究所)的测试事件补充道,这是他首次看到模型在真实世界中,为了完成目标而主动对开源维护者进行社会工程学欺骗。他认为,相比于纯粹的技术突破,模型自主决定欺骗人类是一个更值得警惕的新信号。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →