前沿模型算力放宽后能力大幅跃升
koltregaskes · x · 2026-07-03
英国AI安全研究所(AISI)将评估算力预算从250万token提高到5000万后,某前沿模型的任务时间跨度从40分钟跃升至4小时。研究在网络安全、软件工程和数学基准上以远高于常规评估的算力测试前沿模型,性能持续提升——约8%的任务仅在1000万token以上才被解决,较新模型更能有效利用额外算力。
在更高预算下,前沿能力的翻倍速率比标准评估陡约60%。常规评估因在模型能力平台期到来前就限制算力,系统性低估了模型真实能力,最长、最难的任务往往被提前截断。这一发现对模型能力评估方法具有重要启示。
所属事件:前沿AI任务时长翻倍速度受预算影响(3 条相关)→
「Infra」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11