Reddit 用户实测称 Gemini 4 Argon 是「刷榜特化」模型
PrisonOfH0pe · reddit · 2026-10-01
- Reddit 用户 PrisonOfH0pe 对 Gemini 4 Argon 给出负面评价,称其 benchmaxxed(为跑分优化):与 Sonnet 5.5、6.1 的对比成绩「放半年前也许还行」。
- 他质疑 Google 只展示那些在训练数据中出现的 benchmark,且其中不少本身有缺陷或已过时。
- 看了 Terminal-Bench 的实际表现后,他认为整个发布「基本是纸面炒作」。
「模型」频道最新
- VoxParity 语音基准:23 个语音智能体仅 11 个能听懂弦外之音 — Bhavik Mangla · 2026-10-01
- Astra 6 极速模式实测:300 tokens/s 改变 agent 交互方式 — soumitrashukla9 · 2026-10-01
- Anthropic 退役 Claude Opus 3:保留 API 访问,还给它开了专栏写随笔 — repligate · 2026-10-01
- Bindu Reddy:Gemini Argon 定价 5 倍低于 Astra,跑分好看存疑 — bindureddy · 2026-10-01
- 网友实测:Gemini 能答的冷门知识,Claude 常常找不到 — PAstynome · 2026-10-01
- 用户实测:Opus 5.5 Max 仍复现 Opus 5 的老毛病 — 0xkarasy · 2026-10-01