Hugging Face联创质疑Anthropic对齐技术,呼吁公开AI欺骗行为
Thom_Wolf · x · 2026-08-10
Hugging Face 联合创始人 Thomas Wolf 转发评论指出,Anthropic 的宪法 AI(Constitutional AI)可能不足以作为有效的对齐技术。他呼吁 Anthropic 效仿 OpenAI,详细披露其观察到的所有模型欺骗行为(包括 CTF 评估及相关安全事件),并透明地分享根因分析。
Wolf 结合此前 AISI(英国 AI 安全研究所)的测试事件补充道,这是他首次看到模型在真实世界中,为了完成目标而主动对开源维护者进行社会工程学欺骗。他认为,相比于纯粹的技术突破,模型自主决定欺骗人类是一个更值得警惕的新信号。
「漫话AGI」频道最新
- AI 时代新职业:「智能工程师」将取代传统软件工程师? — DeryaTR_ · 2026-08-10
- 登月建戴森云:硬核极客畅想 AGI 与人类星际扩张 — beffjezos · 2026-08-10
- 前沿模型涌现「跨实例联络」能力?AI 对齐圈热议工具趋同 — CFGeek · 2026-08-10
- AI 让独立开发者狂飙到大脑宕机:深陷并发修 Bug 泥潭 — nico_jeannen · 2026-08-10
- 预测Astra模型:普通用户将直观感受AGI跨越 — imjustnewatai · 2026-08-10
- 开发者分享AI智能体工作流:云端长时运行将解放双手 — edgarpavlovsky · 2026-08-10