提交时间暴露后训练差异:GLM 5.3、Kimi K3 等开源模型超 10 小时才交卷
nrehiew_ · x · 2026-09-03
通过分析模型在长程任务中的提交时间线,作者推断各家模型长程后训练的多少:Sol 和 Fable 提交较早,其中 Fable 持续工作的时间明显更长;而多数开源模型包括 GLM 5.3、Kimi K3 和 Qwen 3.8 Max 提交极晚(超过 10 小时),说明它们对时间与预算概念把握较差。
「模型」频道最新
- 研究者吐槽 LLM 文档滥用习语:一小时读不完几页文档 — ZeeshanZiaML · 2026-09-03
- Gemini 3.8 帕累托前沿位置仅保住 3.5 小时即被超越 — giffmana · 2026-09-03
- 爆料称 OpenAI 或于周四发布传闻中的新产品 Astra — D3VAUX · 2026-09-03
- Muse Spark 1.3 发布,附一行 curl 命令即可安装 Muse Code — alexandr_wang · 2026-09-03
- 开发者预测:各家 AI 实验室或很快推 nightly 版模型检查点 — intellectronica · 2026-09-03
- Muse Spark 1.3 实测:用 Muse Code 把想法变成可玩 3D 世界 — zhuohan123 · 2026-09-03