Reddit 讨论:你真正信任的公开 LLM 基准测试有哪些?
ThomasAger · reddit · 2026-08-22
Reddit 用户发帖询问社区在面对新模型发布时,究竟参考哪些公开基准测试来评估模型能力,还是完全依赖自测。帖子引发了关于外部评测可信度与个人实测对比的讨论。
「模型」频道最新
- Gemini 3.7 Flash 首周打破增长纪录,ARC-AGI 测试成绩亮眼 — fchollet · 2026-08-22
- GPT-5.6 Sol 降至每百万 Token $4 — firstadopter · 2026-08-22
- Reddit 传闻:谷歌即将发布 Gemini 1.5 Pro — MrWidmoreHK · 2026-08-22
- Qwen3.8-27B 破圈:27B 模型能在笔记本跑出惊艳效果 — minchoi · 2026-08-22
- Flash-0731 评测曝光:推理与视觉能力超越预期 — teortaxesTex · 2026-08-22
- 评估实战:超越虚荣指标,如何衡量用户体验 — gabriel1 · 2026-08-22