UK AISI 论文:固定预算评测低估前沿模型,放开推理算力成绩大增

evijit · x · 2026-09-23

AI 安全研究所(AISI)联合 EvalEval 团队发布新论文《How Inference Compute Shapes Frontier LLM Evaluation》,并以 Eval Cards 形式公开评测方法、数据与完整对话记录(HF 上全部数据开源)。

核心发现:

结论对评测方法论影响重大:低分可能反映评测设置而非模型能力,发布评测结果时应报告算力预算。

所属事件:英国AISI推出Eval Cards公开评测方法(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →