中国团队首发原生 RSI 模型 BigBang-V1,35B 参数击败 DeepSeek V4
新智元 · wechat · 2026-08-06
上海交大、深势科技等组成的「无尽前沿团队」发布了首个基于原生递归自我改进(RSI)训练的 35B 基座模型 BigBang-V1。该模型在多项高难度科学基准测试中表现优异,以 35B 的参数量击败了 1.6T 参数的 DeepSeek V4 Pro。
RSI 闭环机制
BigBang-V1 的核心突破在于其 100% 由 AI 合成的数据流水线。系统构建了 Generator(出题与改造)和 Critic(审查与挑刺)两类智能体,并外接真实测试。如果 Critic 打高分但模型训练后能力未提升,系统会用真实结果校准 Critic,从而形成“真实任务暴露缺口→造题筛题→训练→真实检验→校准”的完整闭环。
强悍的科学推理能力
- 高分基准:在 OpenAI 的 Frontier Science Research 上得分 46.2;在 Scale AI 的 Humanity's Last Exam 上得分 50.3;在 PaperBench (Code-Dev) 上得分 53.6。
- 实战表现:在生物信息学测试中能精准识别病毒并复现学术论文,甚至能挑出论文原设定中的逻辑矛盾并予以修复。此外,它还能串联多个开源模型完成复杂的抗体设计流水线。
团队表示,科学任务因其“前沿性”和“可验证性”,成为训练通用智能的最佳练兵场。该模型证明了无需单纯堆砌参数,通过 AI 迭代 AI 的数据范式创新即可实现性能飞跃。
「模型」频道最新
- Qwen3.8-Max自主开发CLI工具:连续16天无人工干预 — socialwithaayan · 2026-08-06
- Qwen3.8-Max 实测:16天零干预写出CLI工具,长程任务大幅提升 — socialwithaayan · 2026-08-06
- 多名用户反馈 OpenAI Codex 5.5/5.6 编程辅助表现强劲 — tokenbender · 2026-08-06
- Tilelli LLM:采用每 Token 路由机制的开源反幻觉模型 — themoroccanship · 2026-08-06
- Claude Opus 5 登顶全栈代码榜首,大幅领先 Kimi K3 — rohanpaul_ai · 2026-08-06
- API实测:OpenAI各档位模型性价比均超Claude — Over-Necessary-4774 · 2026-08-06