Gemini 3 刷新 ARC-AGI-2 纪录,Deep Think 准确率达 45%
typewriters · x · 2026-08-10
Jeff Dean 转发了 ARC Prize 基准测试的最新数据,确认 Google 的 Gemini 3 系列模型在 ARC-AGI-2 评测中取得了显著突破,大幅提升了当前的最优(SOTA)表现。
具体成绩方面:
- Gemini 3 Pro:准确率达到 31.11%,单任务成本为 0.81 美元。
- Gemini 3 Deep Think(预览版):准确率翻倍至 45.14%,但单任务成本高达 77.16 美元。
这表明新模型在成本与准确率的权衡上进一步拓展了帕累托前沿。
「模型」频道最新
- 推测:Flash-0731 或为同源多模态预训练的视觉模型 — teortaxesTex · 2026-08-10
- Sarvam AI发布105B模型,称多项指标超GPT且成本仅两成 — itsOmSarraf_ · 2026-08-10
- 智源发布自主研究智能体 AREX:10B 参数比肩 GPT-5 旗舰 — 新智元 · 2026-08-10
- Pinterest财报:开源模型微调成本仅为闭源的8% — juliey4 · 2026-08-10
- 字节发布抖音多模态嵌入模型,已上线搜索业务 — ByteDance · 2026-08-10
- 研究者称整合Cursor数据奏效,Grok 4.6编码能力将比肩前沿大模型 — DeryaTR_ · 2026-08-10