被测评标题党坑惨?Reddit 求问:哪里能查 LLM 真实水平
Sarlo10 · reddit · 2026-09-15
Reddit 用户吐槽:内容创作者动辄宣称新模型是 AGI、其他模型都不行了,而跑分基准又常被「作弊」刷高,问 AI 自己搜到的也全是不可信来源,想知道在哪能获得 LLM 实际使用中的真实对比信息。他还提出典型疑问:中国模型真有那么强吗?还是像 Claude 那样不需要高质量提示词也能出好结果?帖子引发对可靠评测信息源(真实用户口碑 vs 被刷的榜单)的讨论。
「模型」频道最新
- 孪生素数界从246推进到188,GPT-6 Astra发布前夕再推至186 — RexDouglass · 2026-09-15
- OpenAI 桌面端语音降价约 60%,ChatGPT 语音时长扩至 2.4 倍 — athyuttamre · 2026-09-15
- 多家实测 high 档反超 max,博主批厂商刷分后包装最佳实践 — karminski3 · 2026-09-15
- Qwen3.8 27B 鹈鹕测试:0.21 美元跑出付费模型 3 美元效果 — DivideHorror3217 · 2026-09-15
- LlamaIndex 回击 Cohere Parse:Cohere Parse 五维基准仅约 50% 均分 — ravithejads · 2026-09-15
- DeepSeek 算子工程师自述:明知 AI 将取代自己,仍选择亲手加速这一进程 — WebAssemblyMan · 2026-09-15