Reddit 用户呼吁建立客观基准,量化模型发布后被「削弱」速度
demeyer1 · reddit · 2026-09-22
一位 Reddit 用户提出:目前缺少持续追踪 OpenAI 模型发布后质量衰减(nerf)的客观测量体系。
- 以 Sol Ultra 为例:发布首周表现「超人」,随后单位花费的实际效用明显下降,但现有数据不一致,只能算轶事级证据。
- 希望有站点用固定基准集持续跑分,量化模型被削弱的速度,并判断它是否动态(如因算力不足而调整),从而预测何时能拿到更高质量的输出。
- 作者的小型创业公司自己跑过基准,但成本上升很快;他们想避免其他人遇到的用量被快速消耗、之前好用的任务变得不稳定的问题。
「Infra」频道最新
- LLM推理提速实操:以31B模型为例讲透TPS优化 — abhijithneil · 2026-09-22
- rakyll:全托管平台因丧失可组合性与可复现性而失败 — rakyll · 2026-09-22
- 本地 Qwen 27B Agent 接管亚马逊账号,一次跑通自动买纸 — fuzhongkai · 2026-09-22
- CBS 60分钟:高尔夫球场用水是数据中心的2倍多 — SumitGup · 2026-09-22
- R9700+Strix Halo 实测:ROCm 仍领先 DeepSeek,Vulkan 追近差距 — Hrethric · 2026-09-22
- DeltaTensors 给微调模型做增量存储:953MB 压到 294MB — cupheadgamer · 2026-09-22