LMArena 疑现 Gemini 4 间谍模型:SVG 质量远超同门
Background-Youth7289 · reddit · 2026-09-20
Reddit 用户在 LMArena 用「骑自行车的马」SVG 提示词测试,对比标注为 Gemini 3.8 Flash High 与 Claude Fable 5.1 High 的两个匿名模型:
- Gemini 结果耗时约 30 分钟生成,Claude 约 5 分钟——与此前「Fable 更慢」的报告相反。
- Gemini 的 SVG 质量显著更好,差距之大不像 Flash 级别模型应有的水平。
- 作者怀疑该标签下实际跑的是更新的实验性 Gemini 模型(可能是 Gemini 4 代),但承认无法验证,属基于输出质量与耗时的推测。
- 帖内征求其他人在 LMArena 看到异常强结果的案例。
属于可信度中等但值得留意的匿名模型测试传闻。
「模型」频道最新
- 四模型同跑 Doom 实测:Jev 平均击杀 5.63 倍碾压微调 Qwen3.5 — shniydder · 2026-09-20
- 研究者警告:LLM 关键任务中的性能退化必须认真对待 — doodlestein · 2026-09-20
- Jev 做 LLM 评测裁判:快 20-200 倍,跑一堆提示不到 0.1 美元 — minchoi · 2026-09-20
- Step 5 Preview 开放试用,Step 订阅限时免费 — StepFun_ai · 2026-09-20
- 阶跃自建 FinStepBench,主打 Step 5 Preview 金融分析能力 — StepFun_ai · 2026-09-20
- Step 5 Preview 可连续执行 24 小时任务,含 GPU kernel 优化 — StepFun_ai · 2026-09-20