早期测试显示 Gemini 3.5 Pro 不再像 3.1 Pro 那样懒
Able-Line2683 · reddit · 2026-07-26
有用户称,Gemini 3.5 Pro 的早期 Arena 测试结果显示,它可能不再像 Gemini 3.1 Pro 那样“懒”。
- 这条帖子提到,Gemini 3.5 Pro 正在 Arena AI 网站的 battle mode 里进行多 checkpoint 测试。
- 在他们的实测中,模型一次生成了 20+ 个独立代码文件,每个文件都有数百行代码。
- 发帖人认为,这比自己测过的其他模型都更“能写”,说明此前 Gemini 系列常见的“懒输出”问题可能会被修掉。
- 不过这仍然只是非官方、偏轶事性质的测试结果,不是正式基准。
「模型」频道最新
- Claude使用截图曝光Max计划限额与1775美元积分消耗 — letandrewcook · 2026-07-26
- 开源 4B 模型在瑞典医学考试上逼近 o3 水平 — AccomplishedCat4770 · 2026-07-26
- Claude Opus 5 在 WeirdML v2 得分 86.3%,仍输出七千多 token — xeophon · 2026-07-26
- ChatGPT 两小时提示词产出一篇论文式数学推导 — airkatakana · 2026-07-26
- Baseten 用 247 条虚构事实测试 Qwen3,权重记忆仍不稳 — gerardsans · 2026-07-26
- 实测 Claude Opus 5:高负载下 Token 消耗极低 — CtrlAltDwayne · 2026-07-26