网传 Gemini 4 Pro 跑分泄露,博主泼冷水:基准分数不等于智能
VraserX · x · 2026-09-28
网络上流传所谓 Gemini 4 Pro 的泄露跑分,声称若属实将碾压 GPT-6 Astra 与 Claude Opus 5.5。博主 VraserX 表示高度怀疑。
- 他认为泄露图「非常可能是假的」
- 即便属实,也提醒 Google 有「benchmark-maxxing」前科:通过 RL 针对性过拟合特定能力(如 SVG 生成),让人看到一条惊人跑分或 demo 就以为「AGI 到了」
- 核心观点:基准成绩不是智能,对未经证实的跑分应保持怀疑
所属事件:网传 Gemini 4 Pro 跑分泄露抢戏 OpenAI DevDay(3 条相关)→
「模型」频道最新
- 曝 OpenAI 同款模型在 API 可用 832 juice,Codex 仅 128 — legit_api · 2026-09-28
- RTX 5090 本地编码模型怎么选:Qwen 27B 200TPS 与 Flash 50TPS 之间找平衡 — MasterNomie · 2026-09-28
- Anthropic 工程师一条 prompt 让 Opus 5.5 做出带配乐的剪辑视频 — felixrieseberg · 2026-09-28
- Opus 5.5 引爆创意玩法,博主盘点 10 个 wild 案例 — CodeByPoonam · 2026-09-28
- 不用扩散模型:Opus 5.5 仅靠提示词生成 18 分钟视频,成本约 5 美元 — Afinetheorem · 2026-09-28
- AI 基准测试创业公司 Vals 获 a16z 领投 4000 万美元 A 轮 — dl_weekly · 2026-09-28