AI 圈双标现场:开源模型跑分差被嘲,跑分好又被疑挖人
teortaxesTex · x · 2026-08-04
推文调侃了 AI 社区内对开源模型评测成绩的“双标”现象:
- 当开源模型在新基准上表现不佳时,社区往往抛出“正如我所料,之前只是在刷榜”的嘲讽。
- 而当开源模型真正取得领先时,评论风向却变成了“前沿大厂的人力资源部没在干活吗(暗示大厂应该去挖开发者)?”
原贴上下文还提到,Moonshot 等团队创建了大量 kernel RL(强化学习)环境,而 OpenAI 和 Anthropic 在这方面显得过于吝啬,尽管这种环境对于验证推理优化等服务端性能极具价值。
「Fun」频道最新
- 一条帖子列出三档 GPT 5.6 版本和参数量梗 — AndyMasley · 2026-08-04
- 研究者调侃:论文统计是计算器算的,不是 AI 编的 — DrDatta_AIIMS · 2026-08-04
- Claude 会话额度告警被做成了一张梗图 — iamaliveix · 2026-08-04
- 本地跑 Qwen 3.6 35B 读堆栈的痛感,被做成了一张梗图 — haydendevs · 2026-08-04
- Gauntlet Loop 据称一把做出了 AI 纪录片 — draginol · 2026-08-04
- 一件 T 恤把“Gooner”梗直接做成了设计 — Delahuntagram · 2026-08-04