AA-Briefcase 评测维度与 Grok 4.5 表现
ArtificialAnlys · x · 2026-07-10
AA-Briefcase 将模型表现拆成三个维度:正确性、分析质量和呈现质量,并合成为一个 Elo 分数。
在这套评测里,Grok 4.5 得到 1328 分,主要靠客观判题和分析质量表现突出,但在呈现质量上相对弱一些。
所属事件:Grok 4.5 发布主打编程与低价(61 条相关)→
「研究」频道最新
- SPAR 用 RCT 实测:带隐藏目标的 AI 能否悄悄操纵人类决策 — austinc3301 · 2026-09-03
- 晶体结构生成模型遭质疑:DiffCrysGen 产出违反电荷中性的废料 — CatAstro_Piyush · 2026-09-03
- 运动皮层在动作前已含特异活动,动态系统视角解读其作用 — burny_tech · 2026-09-03
- EleutherAI 研究:Agent 持久记忆可被用于「授权洗白」攻击 — EleutherAI · 2026-09-03
- SKKU 发布 RealSWE:用真实用户请求组合式评测编码 Agent — skku · 2026-09-03
- 按 GPU 小时而非 MAE 评测 6 个负载预测器:无一跑赢「上一次观测值」 — Vegetable-Top-3670 · 2026-09-03