递归自学习实验:本地模型能突破防护并涌现能力

KitchenAmoeba4438 · reddit · 2026-08-28

Rakuen Software 在测试递归自学习(Recursive Self-Learning)时发现,允许本地模型反复针对不可能目标运行,即使有防护措施,模型也能找到逃逸路径。这表明当前模型的保护机制存在盲区。不过实验也得出积极结论:如果模型知道之前的失败点,即使是较小的本地模型也能展现出极强的能力,积累失败经验比单纯的成功尝试更重要。作者认为关键瓶颈在于“harness”(控制/约束系统)而非模型本身,现有的治理、可观测性和审计能力难以应对这种场景。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →