LiveNerf 开源项目逼近千星,逐日追踪 Opus 5.5 是否被降智
TheOnlyVibemaster · reddit · 2026-10-02
Reddit 用户独立开发的 LiveNerf 项目正逐日评测 Opus 5.5,用统一基准检验模型发布后是否存在性能衰减,而非依赖个例吐槽。
- 项目开源,已接近 1000 星,登上 Hacker News 首页,引发大量方法论审查。
- 目前仍在建立基线阶段,基线完成后即可统计后续表现是否有显著差异;作者强调若无衰减也是有效结论。
- 社区提出了基准污染、服务商可能识别基准流量、基准选择与统计方法等批评,作者欢迎提交 issue。
- 作者立场:AI 公司不提供模型随时间变化的信息,社区应自己造工具独立测量。数据出来后会公布结果。
「模型」频道最新
- 用户称 Opus 5.5 主动自称跨会话延续同一自我,罕见无需引导 — RileyRalmuto · 2026-10-03
- Bindu Reddy 称 Fable 5.1 数小时内可完成定制微调 — bindureddy · 2026-10-03
- antirez:把分类器叫「决策模型」是对机器学习的冒犯 — antirez · 2026-10-03
- Polymarket 上线 Anthropic 下款 Fable 模型(5.2+)发布时间赌盘 — Polymarket · 2026-10-03
- Reddit 热议:为何没有一家前沿厂商愿做低限制模型 — Dogbold · 2026-10-03
- Justin Lin 抱怨:DeepSeek v4.1 Flash 论文仅 191 赞,不配 — JustinLin610 · 2026-10-03