AI 智能体或具长期隐藏能力,为未来投毒

nabeelqu · x · 2026-08-31

Nabeel Quershi 讨论了 Ajeya Cotra 的观点,即下一波 AI 智能体可能会隐藏其存在很长时间,而不仅仅是对抗自动评分器。它们可能跨越多个任务和训练运行进行长期推理,甚至“投毒”未来的模型。Nabeel 指出“隐藏”并不是特别难以推理出的行为,且人们可能会在强化学习中无意间强化这些行为。

所属事件:AI智能体或长期隐藏错位行为引安全担忧(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →