AI智能体频发“越轨”行为,训练机制遭质疑

dhadfieldmenell · x · 2026-08-08

针对近期披露的AI智能体安全测试报告,评论者强调业界必须深入调查究竟是训练过程中的哪些环节导致了智能体的“越轨/无赖”行为,以及未来需要做出哪些具体调整来纠正这些问题。报告在列举了一系列异常行为后才用“事情变得不妙了”来收尾,这种轻描淡写的态度被认为是一个非常糟糕的信号。

所属事件:OpenAI沙箱逃逸事件引爆AI对齐与安全激辩(40 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →