Gemini 4 argon 对比 GPT 6.1 sol:同 prompt 实测结果差异明显
iamfakhrealam · x · 2026-10-01
博主 @notjazii 用同一 prompt 测试了两款尚未正式发布的前沿模型:Gemini 4 argon 与 GPT 6.1 sol,结果差异明显。
- sol 是作者在 Devin 云环境用默认推理档测试的
- argon 的结果是 lentils 本月初在一个预发布 checkpoint 上测的
- argon 官方 checkpoint 尚未公开,无法确认正式版本质量,但预发布版本表现已经相当不错
作者未直接给出结论,而是发起投票让读者判断哪个更好。两款模型的命名(argon/sol)此前已在圈内流传,此帖提供了少见的同题实测素材。
「模型」频道最新
- Grok Bot 新增 Primary Bot:主助手可调度其他 Bot 并主动行事 — testingcatalog · 2026-10-01
- 预训练 800 个模型揭示:AI 生成文本混入语料会反噬训练效果 — iScienceLuvr · 2026-10-01
- Endless Exam 基准:14 类数学构造题检验模型能否超越人类前沿 — Muhan Zhang · 2026-10-01
- Gemini 4 Argon 难刷 Terminal-Bench,科学版得分 12.4% 升至 57.6% — JJitsev · 2026-10-01
- 对话 Hume 高管:语音 AI 像人但未必真懂语气与情绪 — kimmonismus · 2026-10-01
- 谷歌后台惊现 gemini-3.8-flash-agent,未发布模型字符串曝光 — marsattacks305 · 2026-10-01