Reddit 热议:该有工具定期跑同一基准,监测模型 nerf
spinozasrobot · reddit · 2026-09-26
Reddit 用户提议做一个「nerf 检测器」:目前常见模式是模型发布时跑分亮眼、社区兴奋,随后用户陆续抱怨能力悄悄退化(nerfing)。作者建议对同一组 benchmark 随时间持续重跑、绘制趋势曲线,以跨模型、跨实验室对比能力变化,并询问是否已有类似项目。讨论反映了社区对「发布后模型静默降级」缺乏系统性监测工具的不满。
「模型」频道最新
- Decision Index 新权重法:类目按基准数开平方分配,艺术品味固定 10% — multimodalart · 2026-09-26
- Decision Index 0.2.1 更新:修复 SGD 基准缺陷并调整类目权重 — multimodalart · 2026-09-26
- Aider 作者吐槽:出钱养实验室却被护栏告知代码该怎么写 — zeeg · 2026-09-26
- AI 长帖为何讨赞:LLM 学会了优化人类偏好的「slop 体」 — AymericRoucher · 2026-09-26
- GPT-6 Sol 对比 Opus 5.5:Sol 行文更精炼,Opus 点题偏慢 — every · 2026-09-26
- Liquid 团队谈端侧 Agent 模型:真正的关键在后训练 — alexcovo_eth · 2026-09-26