开发者吐槽 LLM 排行榜无参考价值:各家自测口径不同
jdluk87 · x · 2026-09-23
开发者 jdluk87 吐槽新出的各家 LLM 模型对比图表「几乎一文不值」:因为每个机构都用自己的一套测试方式,所以每家都说自己的新模型更强,对比结论不具备可比性。
「模型」频道最新
- 曝 Claude Opus 5.5 发布:性能对标 Fable 5.1,成本降 40% — goyalshaliniuk · 2026-09-23
- 「自画像基准」:Opus 5.5 不再把自己画成人形,且高度一致 — repligate · 2026-09-23
- Steve Yegge 试用 GPT-6 Astra:文笔惊艳但全程莽撞 — Steve_Yegge · 2026-09-23
- 网友晒「Opus 5.5」单独跑 agent 实测,版本号真实性存疑 — alvelda · 2026-09-23
- 同一 Prompt 对决:Opus 5.5 vs GPT 6 Astra 实时 3D 樱花山谷 — dotey · 2026-09-23
- signull:OpenAI 比任何实验室都更有效地压低了高质量智能的成本 — signulll · 2026-09-23