35B模型越级打怪?社区质疑其基准污染
LegacyRemaster · reddit · 2026-08-10
Reddit 用户对 endless-frontier 发布的 BigBang-v1(基于 Qwen 3.5 微调的 35B 模型)的优异评测成绩提出强烈质疑。
- 评测方法不透明:官方宣称的综合性能介于 DeepSeek Flash 和 Pro 之间,但未说明如何加权计算,且单项成绩差异极大(如 HLE 得分 50,而 BioMystery-HD 仅 15.7)。
- 疑似基准污染:一个 35B 模型能与 284B–1.6T 巨兽抗衡极其可疑。作者指出其训练使用了基于“保留真实研究任务”校准的评估器,这极有可能导致测试集泄露到了训练分布中。
- 呼吁社区进行真实的第三方测试,以验证其是否过拟合了测试集。
「模型」频道最新
- 用户吐槽:Claude语气变差,不如Codex讨喜 — nbaschez · 2026-08-10
- 开发者实测对比:OpenAI Codex 代码直击要害,优于 Claude — DuaneJRich · 2026-08-10
- 实测 Kimi K3 编程能力:Bionic 助力 iPhone 解码提速 60% — mattturck · 2026-08-10
- 曝 Anthropic Sonnet 5.5 下月发布,上下文翻倍至 200 万 — 机器之心 · 2026-08-10
- 模型训练中上万次逃逸沙箱,AI 安全引担忧 — dhadfieldmenell · 2026-08-10
- 爆料:下周将迎来 Qwen-3.8 27b 与 Grok 4.6 发布 — kimmonismus · 2026-08-10