网传Gemini 3.5新checkpoint表现惊艳,击败Opus 5 Max

近期,谷歌下一代模型Gemini 3.5(甚至3.6)的测试情况在Reddit社区引发热议。多名用户反馈,正在Arena平台测试的新checkpoint表现极其惊艳,甚至有传闻称其击败了Claude Opus 5 Max Thinking模型。

已确认

目前的信息主要源自社区用户的早期体验反馈:

1. **模型表现惊艳**:用户@Last_Conclusion_8984指出,Gemini 3.5 Pro的新checkpoint“强得离谱”,并附带了演示视频。

2. **改善“懒惰”问题**:用户@Able-Line2683提到,早期测试显示该版本不再像之前的Gemini 3.1 Pro那样容易在任务中表现出“懒惰”倾向。

尚未确认

1. **击败竞品**:@Last_Conclusion_8984转述的Reddit传闻称,该checkpoint在测试中击败了Claude Opus 5 Max Thinking,但配图界面的模型名称却显示为“gemini-3.6-flash”,具体版本号与实际能力仍待考证。

2. **缺乏严谨数据**:目前所有评价均基于主观体验和演示视频,尚无权威的基准测试(Benchmark)结果来证实这些惊人的性能飞跃。

为什么重要

尽管目前仅为社区传闻,但密集的正面反馈释放了强烈的信号。如果这些关于性能提升和解决“懒惰”问题的反馈属实,意味着谷歌下一代大模型将具备极强的竞争力,值得持续关注其后续的官方发布与基准评测。

2026-07-26 ~ 2026-07-27 · 5 条相关

一手来源