Gemini 3 刷新 ARC-AGI-2 纪录,Deep Think 准确率达 45%

typewriters · x · 2026-08-10

Jeff Dean 转发了 ARC Prize 基准测试的最新数据,确认 Google 的 Gemini 3 系列模型在 ARC-AGI-2 评测中取得了显著突破,大幅提升了当前的最优(SOTA)表现。

具体成绩方面:

这表明新模型在成本与准确率的权衡上进一步拓展了帕累托前沿。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →