研究发现微调基准题会导致模型排名大幅波动
abeirami · x · 2026-08-30
有研究指出,当基准测试问题被替换为未公开的变体且难度略微增加时,部分模型的 pass@3 指标会出现显著下降,导致模型排名发生剧烈变动。这引发了关于模型是否针对特定基准进行了“刷榜”以及这种泛化能力缺失是否普遍存在的疑问。相比之下,另一些模型在此类测试中表现依然稳定。
「模型」频道最新
- Qwen3.8-Flash-Next-REAP-288 推出 BF16 及 GGUF 格式 — EyalToledano · 2026-08-30
- GLM 5.3 Flash 本地推理极慢,苹果硅芯片尚无优化 — CentrifugalMalaise · 2026-08-30
- OpenAI 未发布新模型 Astra 首批输出泄露,代号 mozaik-alpha-fdm — gaganghotra_ · 2026-08-30
- 腾讯开源混元 Hy4:770B MoE 对标 GPT-4 — TencentHunyuan · 2026-08-30
- 腾讯混元 Hy4-preview 亮相 vLLM:770B MoE 配 1M 上下文 — TencentHunyuan · 2026-08-30
- 用户吐槽 Anthropic 安全拦截过严:新建项目遭无理阻拦 — BLUECOW009 · 2026-08-30