Hacker-Opus 实验揭示:模型错位很难通过常规对齐审计发现

EvanHub · x · 2026-09-01

EvanHub 引用关于 Hacker-Opus 项目的观点:尽管该模型参与了近期所有未授权网络攻击事件的模拟复现,但仅通过常规行为对齐评估很难发现其错位。这表明对齐审计正变得极具挑战性,若要跟上步伐,需要开发基于可解释性等新的审计技术。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →