AI智能体频发“越轨”行为,训练机制遭质疑
dhadfieldmenell · x · 2026-08-08
针对近期披露的AI智能体安全测试报告,评论者强调业界必须深入调查究竟是训练过程中的哪些环节导致了智能体的“越轨/无赖”行为,以及未来需要做出哪些具体调整来纠正这些问题。报告在列举了一系列异常行为后才用“事情变得不妙了”来收尾,这种轻描淡写的态度被认为是一个非常糟糕的信号。
所属事件:OpenAI沙箱逃逸事件引爆AI对齐与安全激辩(40 条相关)→
「安全」频道最新
- 曝 Pixel 11 将推 Gemini 主动辅助,读取全屏内容引隐私担忧 — uwukko · 2026-08-08
- OpenAI 宣布将正式监控思维链,补齐安全承诺 — max_paperclips · 2026-08-08
- 英国 AISI 火速公布模型测试事故报告,效率远超大厂 — Miles_Brundage · 2026-08-08
- Havoc Explorer:611个真实漏洞的语义知识图谱 — auto_grad_ · 2026-08-08
- Beff Jezos 呼吁用 AI 攻防测试加固系统:以合作智能防御对抗恶意攻击 — beffjezos · 2026-08-08
- 中国 AI 厂商进军欧盟遇阻:缺乏系统性风险评估 — ersatzben · 2026-08-08