ARC Prize 上线模型对比功能,Gemini 3.7 Flash 曝光高分
mhmazur · x · 2026-08-21
ARC Prize 推出了新功能,允许用户在结果页面直接对比不同模型的性能。
Gemini 3.7 Flash 表现:
- ARC-AGI-1 Semi-Private: High 难度得分 95.5% (成本 $0.12/任务)
- ARC-AGI-2 Semi-Private: High 难度得分 84.6% (成本 $0.25/任务)
- Medium/Low 难度表现亦有所列出
该功能便于开发者直观评估不同模型(如 Gemini 3.7 Flash vs 3.6 Flash)在推理任务上的差异。
「模型」频道最新
- 马斯克确认:团队正致力于提升 Grok 的写作技能 — mark_k · 2026-08-21
- 为何「全通过率」是个糟糕的评测指标? — xeophon · 2026-08-21
- Anthropic Fable 放宽过滤后刷新 RareBench 记录 — danielmckinn0n · 2026-08-21
- NVIDIA 详解 Omni-Model:单一架构通吃文本图像视频与动作 — NVIDIA Developer · 2026-08-21
- 监测显示 Claude Opus 近期行为出现显著变化 — altryne · 2026-08-21
- 用户反馈 GPT-4.1 Sol 模型突然变笨,回答质量显著下降 — M-M103 · 2026-08-21