ResearchArena 框架评估自动化 AI 研发安全

ResearchArena 是一个专门用于研究自动化 AI 研发过程中“破坏行为”与“监控识别”的新框架。该框架的核心聚焦于安全性而非模型能力,重点探讨在智能体可能不可信的情况下,如何有效监控并防范其在参与代码处理等 AI 研发环节时实施作恶或破坏,从而保障研发产出的安全。

2026-07-29 ~ 2026-07-29 · 2 条相关