前沿模型算力放宽后能力大幅跃升

koltregaskes · x · 2026-07-03

英国AI安全研究所(AISI)将评估算力预算从250万token提高到5000万后,某前沿模型的任务时间跨度从40分钟跃升至4小时。研究在网络安全、软件工程和数学基准上以远高于常规评估的算力测试前沿模型,性能持续提升——约8%的任务仅在1000万token以上才被解决,较新模型更能有效利用额外算力。

在更高预算下,前沿能力的翻倍速率比标准评估陡约60%。常规评估因在模型能力平台期到来前就限制算力,系统性低估了模型真实能力,最长、最难的任务往往被提前截断。这一发现对模型能力评估方法具有重要启示。

所属事件:前沿AI任务时长翻倍速度受预算影响(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →