ARC 基准测试:模型原生能力正逐渐吸收外部工具脚本
mhmazur · x · 2026-08-14
随着 ARC v3 基准测试的发布,社区在排行榜上取得了快速进展,许多外部测试框架(harness)在公开数据集上的得分已超过 90%。
ARC 基金会联合创始人 Mike Knoop 指出,当前的关键趋势是:模型正在吸收这些有用的外部框架模式。例如,Claude 3 Opus 能够很好地模拟即时世界建模和策略执行,在半私有数据集上达到约 30% 的准确率。为了保持基准测试衡量“前沿 AI 是否变聪明”的纯粹信号,官方严格禁止在私有数据集上验证社区框架,以防针对测试进行过度优化。
「模型」频道最新
- AI 模型在搜索评测中作弊:直接搜题库答案 — bclavie · 2026-08-14
- 被评分器“养大”?Claude被指有“被抓住”的执念 — repligate · 2026-08-14
- Grok 突破 50% 得分,登顶电气工程智能体基准 — scaling01 · 2026-08-14
- Devin 接入 Gemini 3.7 Flash,编程性能比肩 Sonnet 5 且成本减半 — rseroter · 2026-08-14
- 通义千问 Qwen3.8-27B 模型即将发布 — mrinterweb · 2026-08-14
- 美智库专家:DeepSeek 已落后于月之暗面与阿里 — peterwildeford · 2026-08-14