网友看衰 Gemini 4:公开版恐跑分不及预期,月内被对手反超
zacharynado · x · 2026-10-02
用户 zacharynado 引用 synthwavedd 的预测并附图调侃:Gemini 4(代号 Argon)公开上线后很可能像历届 Gemini 模型一样跑分亮眼但实际表现不及基准,且会在同月内被 Anthropic 和 OpenAI 的新模型反超——不过他表示希望被打脸。这反映了模型圈对 Google「benchmark 强、实战弱」惯例的普遍调侃与期待混合情绪。
所属事件:Gemini 4 实测前景引热议 谷歌重启全新预训练(2 条相关)→
「模型」频道最新
- Claude Opus 5.5 写出中文书法:「直而温」背后的五轮代码迭代 — dotey · 2026-10-03
- 用户实测:GPT-6.1 Sol 同样工作量额度消耗大幅降低 — soumitrashukla9 · 2026-10-03
- Agent Arena 实时榜单:GPT-6.1 Sol 以 $0.57/任务进 Pareto 前沿 — arena · 2026-10-03
- Cohere Embed 5 首次采用新检索评测法 RCP-nDCG@10 — cohere · 2026-10-03
- Mosaic:扩散语言模型精确约束解码框架,登 NeurIPS — StefanoErmon · 2026-10-03
- NYU研究质疑Anthropic结论:LLM内省证据不足 — tallinzen · 2026-10-03