DeepSeek V4 Pro ARC 评测: 分数接近 Flash 但参数倍增
teortaxesTex · x · 2026-08-31
DeepSeek V4 Pro 在 ARC-AGI 基准测试中取得 90.5%(ARC-AGI-1) 和 61.3%(ARC-AGI-2) 的成绩,单任务成本分别为 $0.18 和 $0.60。数据对比显示,其得分仅比 Flash-0731 版本低 0.1%,且在不同推理强度下表现稳定。分析指出,鉴于所有更新版 V4 模型在第三方评测中水平相近,目前尚不清楚 V4 Pro 多出的 5.6 倍总参数和 3 倍激活参数带来了哪些实质收益。
「模型」频道最新
- Google 封了 Jeff Dean 的账号,Gemini 3.5 Pro 仍是" soon" — ryanmerket · 2026-08-31
- 用户吐槽 GLM 5.3 Flash 简单提示词过度思考且报错 — nahmanhuh · 2026-08-31
- 实测:Qwen3.8-Flash-Next 速度快但在复杂推理中会“假死” — trashacct383 · 2026-08-31
- 谷歌 AI 模型被曝输出针对拉丁裔的种族主义内容 — HelpfulQuestions · 2026-08-31
- Taalas 模型演示达 1.4 万 tokens/秒 — rohanpaul_ai · 2026-08-31
- RLVR 技能为何能迁移?模型训练缺乏严谨理论 — voooooogel · 2026-08-31