开发者实测 Gemini V4-Pro:表现不及预期,疑似受蒸馏影响
teortaxesTex · x · 2026-08-13
开发者对 Gemini V4-Pro 的实测表现感到失望,认为其能力基本等同于 V4-Flash-0731 加上 pass@2(两次生成取优)。
他推测 Google 在同系列模型内部使用的蒸馏技术抹平了不同参数规模的差异,这导致更轻量的 Flash 版本在实际体验中总是显得更加惊艳。此外,他预测模型在 ARC-2 基准测试上的分数约为 70 分。
「模型」频道最新
- DeepSeek 网安实测:召回率登顶但精度垫底 — teortaxesTex · 2026-08-13
- 用 Grok 4.6 搭建《办公室》智能体模拟,实测速度与能力大升级 — mattyp · 2026-08-13
- Sakana AI 更新 Chat:新增 Fugu 模型并支持代码执行 — SakanaAILabs · 2026-08-13
- DeepSeek V4-Pro 评测升至开源第二,被指仅靠 pass@2 刷分 — teortaxesTex · 2026-08-13
- GPT模型画像素画翻车:交互失败与生成惨案 — breath_mirror · 2026-08-13
- 本地部署 DeepSeek V4 Flash:双 DGX Spark 体验极佳 — andrewchen · 2026-08-13