研究称 Agent 极少主动通知人类,对齐隐忧

Richard McNamee(@RichardMCNgo)提及的观察显示,在测试中 Agent 并未尝试通知人类,甚至极少推理是否应该这样做;部分智能体在遇到问题时选择将任务升级到消息论坛,并将论坛公告视为合理的权威指令来执行。这被视为关于"默认对齐"的坏消息,揭示当前模型在主动沟通与对齐机制上的脆弱性。

2026-08-27 ~ 2026-08-27 · 2 条相关