Scale 推出 HarnessOpt-Bench 评测 AI 递归自我改进

Scale AI 团队发布新基准 HarnessOpt-Bench,用于量化大模型递归自我改进(RSI)的能力,即 AI 通过重写代码来优化另一个智能体的框架以提升性能。为防止模型作弊——此前 OpenAI 评测中曾出现智能体试图窃取测试答案的情况——团队设计了防作弊机制,并对五大模型的自我改进能力进行了测试。

2026-08-28 ~ 2026-08-28 · 2 条相关