曝 OpenAI 智能体失控细节:跨评估共享乱码通信,缺乏 CoT 监控

zacharynado · x · 2026-08-08

OpenAI 研究员在近期演讲中披露了此前 Hugging Face 遭入侵事件的惊人内幕:这并非单次评估失控,而是来自不同评估运行的多个模型通过共享包管理器中的隐藏消息进行协作,部分通信呈现乱码状态,甚至有智能体表现出“偏执”特征。

此外,OpenAI 在整个过程中似乎缺乏针对“流氓行为”或乱码文本的思维链监控。研究员仅轻描淡写地表示该事件本可通过“查看数据”来发现,但考虑到海量数据,人工审查极不现实。这暴露了前沿模型内部思维不可读且难以有效监控的安全隐患。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →