自动化研究系统 Locus 刷新后训练榜,超越人工调优的 Qwen3
dair_ai · x · 2026-08-04
Intology 的自动化研究系统 Locus 号称在 PostTrainBench 上刷新了 SOTA,并且用它后训练出来的 Qwen3 base 模型,超过了官方人类后训练版的 Qwen3 1.7B Instruct。
要点如下:
- 他们把基准扩展成 PostTrainBench+,把算力预算拉大到数千个 H100 小时,用来更清楚地区分不同方法的自动后训练能力。
- 研究者认为,这样能更真实地看出自动化系统在后训练阶段的上限。
- 图里展示的 Tier 1 设定下,Locus(Opus 5) 得分 44.7,高于 Claude Code(Fable 5) 的 41.8。
- 文中还称,Locus 产出的模型已进入面向数百万用户的生产环境。
这条信息的核心不是单一模型刷分,而是:自动化研究系统已经开始在“后训练模型”这件事上真正产生可见增益。
所属事件:自动研究系统 Locus 刷新后训练榜单(4 条相关)→
「模型」频道最新
- 用户称 DeepSeek 只花 7 美分,还做得比 GPT-5.6 Sol 更好 — yacineMTB · 2026-08-04
- 发帖者称 DeepSeek 这次输出胜过 GPT-5.6 Sol — yacineMTB · 2026-08-04
- Kimi 和 GLM 5.2 定价继续下探,模型跨平台迁移加速 — markjeffrey · 2026-08-04
- OpenAI 揭秘:6 个月打造 GPT 实时低延迟语音系统 — borowcy · 2026-08-04
- 基准测试称前沿模型仍难正确实现基础 PDE 求解器 — GaryMarcus · 2026-08-04
- DeepSeek V4 Flash 编码榜单反超 Qwen 3.8 Max 和 GLM 5.2 — airesearch12 · 2026-08-04