基准论文称单任务评测可烧超 3000 美元榨出更多能力

dejavucoder · x · 2026-08-04

一篇基准论文在强调:评测预算越高,越能“榨出”模型能力

帖子截图来自一篇对软件重现类 benchmark 的讨论,重点不是单纯刷分,而是说明不同评测方法在推理预算上的差距非常大。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →