Gemini 4 Pro 泄露跑分与定价流出:标称约为竞品 1/5 成本、2M 上下文
Wanderspor · reddit · 2026-09-27
Reddit 用户汇总了流传中的 Google Gemini 4 Pro 泄露数据与 Arena.ai 隐身测试(挂 gemini-3.8-flash 占位名),称若 10 月真的按此发布,前沿模型经济将剧变(未证实爆料)。
1. 标称跑分领先(Agentic 与编码)
- DeepSWE v1.1:88.7%(对比 GPT-6 Astra 86.9%、Claude Fable 5.1 的 69.1%)
- Terminal-bench 2.1:95.3%(Astra 为 94.1%)
- GDPval-AA v2(知识工作):2064 Elo,唯一突破 2000 的模型
- OSWorld-2.0:86.8%(Astra 84.5%)
Arena 盲测的定性反馈(复杂 Three.js 生成、多步 JSON/SVG 输出)与这些数字基本吻合,指向 Google 主攻长时程 agentic 任务。
2. 单价经济离谱
- Gemini 4 Pro:输入 $2.25 / 输出 $11.25(2M 上下文)
- GPT-6 Astra:约 $12 / $60(1M 上下文)
- Claude Fable 5.1:$10 / $50(不含激进缓存)
若按 Astra 约 1/5 定价且上下文翻倍,将打破当前自主 agent 的定价体系。
3. 关于 RSI 的争论
不少讨论把跃升归因于递归自我改进,但作者认为公开可验证的更像策略级改进(类似 Google 已发表的 Dream-RSI 论文)加上大规模算力预训练,而非完整自主自我改进循环。
作者建议:等模型 ID 上线端点后用真实 pass rate 验证泄露表,别急着锁定长期 API 合同。
所属事件:疑似 Gemini 4 Pro 匿名现身 Arena 暗测(8 条相关)→
「模型」频道最新
- 照片转 CSV 实测:Claude 基础模型反超 Gemini 旗舰 — Heisenricher · 2026-09-28
- 网传 v4.1 pro 将随 DSH 官方发布?当事人辟谣:没说过 — teortaxesTex · 2026-09-28
- 你在读的真是模型的思维链吗?忠实性质疑再起 — stochasticchasm · 2026-09-28
- 有实测称 Claude Opus 5.5 视觉设计能力为当前所有模型之最 — FinanceYF5 · 2026-09-28
- 长视频生成非一次性扩散,是 LLM 编排数小时的流水线 — cgarciae88 · 2026-09-28
- dhh 盛赞 Anthropic Opus 5.5:「炒作是真的,他们做了魔法」 — gaganghotra_ · 2026-09-28