实测 20+ 第三方模型对标 Gemini:无一达标,「平庸荒漠」
julianharris · x · 2026-09-30
作者 julianharris 分享了一次针对第三方模型生态的大规模实测:以「spec 质量」为标准,寻找是否有比 Gemini materially 更便宜的替代品,对比对象包括 DeepInfra 上架的全部模型。
- 结论:所有模型都失败了,没有一个能在质量上与 Gemini 3.6 Flash 竞争
- 他在开跑前与 Claude 打赌预测结果并赢了——多数第三方模型因「太老」而跟不上今天的 SOTA
- 本以为免费的中国开源模型会给第三方推理平台带来价格优势,实际并没有
- 一天内评测了 20 多个模型,称其为「平庸的荒漠」
- 尽管一年内价格涨了 10 倍、1 月还要再翻倍,Gemini 在他的用例中依然碾压
「模型」频道最新
- 博主横评:GPT 6.1 SOL 强于推理分析,Fable 与 Opus 专精编码 — bindureddy · 2026-09-30
- 用户实测 Opus 5.5:速度快但常无视技术规格自行改写代码 — ssh4net · 2026-09-30
- 前沿模型正吞并专业视觉模型的地盘:CV 能力长文盘点 — ShahabBakht · 2026-09-30
- 18 个月智能-成本前沿巨变:从 GPT-5 mini 17 分到 Opus 5.5 拿下 58 分 — ArtificialAnlys · 2026-09-30
- OpenAI 发布 dots 仅限付费当天,开源版 Open Dots 数小时复刻 — victor_explore · 2026-09-30
- Steve Yegge 持有 22 个 Claude Max 账号,靠周重置活动继续高强度炼丹 — Steve_Yegge · 2026-09-30