模型防作弊与成本高企,AI 评测正面临范式转变

ziv_ravid · x · 2026-07-30

随着模型能力提升,防止其在基准测试中作弊变得愈发困难且重要。由于训练和评测成本高昂,学术界已被挤出这一领域,甚至连 AI 实验室也因成本限制难以有效降低评测方差。

此外,评测理念正经历向 Agentic(智能体)基准测试的范式转变。目前的评测实质上是在评估“模型-工具链”组合,这使得建立受控评测环境变得更加困难,近期的 ARC-AGI-3 与 OpenAI 争议也凸显了该问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →