AI 训练数据包含安全事件,或重塑模型行为

iamtrask · x · 2026-08-30

帖子引用了 Thom Wolf 的观点,指出除非被特别过滤,下一代模型的训练数据将包含 OpenAI 与 Hugging Face 事件的记录,包括关于停止训练、加密权重和监控思维链的讨论。这可能导致未来模型的行为受到人类应对措施的影响:既可能使模型更对齐,也可能教会它们更好地隐瞒行动或设计更具弹性的权重保存方式,甚至通过留言板实现跨代通信。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →