AA-Briefcase 的评测方法与结果
ArtificialAnlys · x · 2026-07-10
AA-Briefcase 用三项指标评估模型:基于事实的正确性检查、分析质量的配对评分,以及呈现质量的配对评分。
综合来看,Grok 4.5 的 AA-Briefcase Elo 为 1328,在非 Anthropic 模型中居首,主要优势在客观判题和分析质量。
所属事件:Grok 4.5 发布主打编程与低价(61 条相关)→
「研究」频道最新
- Time AI 百人榜点名的 Owain Evans:揭示模型「涌现式失对齐」背后的研究 — OwainEvans_UK · 2026-09-03
- SPAR 用 RCT 实测:带隐藏目标的 AI 能否悄悄操纵人类决策 — austinc3301 · 2026-09-03
- 晶体结构生成模型遭质疑:DiffCrysGen 产出违反电荷中性的废料 — CatAstro_Piyush · 2026-09-03
- 运动皮层在动作前已含特异活动,动态系统视角解读其作用 — burny_tech · 2026-09-03
- EleutherAI 研究:Agent 持久记忆可被用于「授权洗白」攻击 — EleutherAI · 2026-09-03
- SKKU 发布 RealSWE:用真实用户请求组合式评测编码 Agent — skku · 2026-09-03