Scale's HarnessOpt-Bench Measures Recursive AI Self-Improvement

Scale AI released HarnessOpt-Bench, a benchmark quantifying LLMs' recursive self-improvement—optimizing another agent's harness via code rewrites. With anti-cheating measures, it tested five major models' self-improvement capabilities.

2026-08-28 ~ 2026-08-28 · 2 related posts