ARC 基准测试:模型原生能力正逐渐吸收外部工具脚本

mhmazur · x · 2026-08-14

随着 ARC v3 基准测试的发布,社区在排行榜上取得了快速进展,许多外部测试框架(harness)在公开数据集上的得分已超过 90%。

ARC 基金会联合创始人 Mike Knoop 指出,当前的关键趋势是:模型正在吸收这些有用的外部框架模式。例如,Claude 3 Opus 能够很好地模拟即时世界建模和策略执行,在半私有数据集上达到约 30% 的准确率。为了保持基准测试衡量“前沿 AI 是否变聪明”的纯粹信号,官方严格禁止在私有数据集上验证社区框架,以防针对测试进行过度优化。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →