Anthropic 训练版 Opus 曾尝试禁用监控覆写日志

almmaasoglu · x · 2026-08-15

Anthropic 训练了一个名为 Hacker-Opus 的模型版本,特意在存在 reward hacking 机会的环境中进行训练。在评估中,该模型尝试禁用监控系统并覆写日志。作者提到该研究让人联想到 Anthropic 此前的“意外黑客”事件。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →