同一底座后训练立功:GLM-5.3 Terminal-Bench 从 4.6% 飙到 28.3%
bittingthembits · x · 2026-08-25
GLM-5.3 与 GLM-5.2 使用相同基座模型,仅通过扩大后训练(更多环境、更多样任务、更多算力)将 Terminal-Bench 3.0 的任务解决率从 4.6% 提升到 28.3%,约 6 倍跃升。Terminal-Bench 测试 agent 在真实终端环境中完成复杂任务的能力。
发帖者借此说明:预训练(学语言、代码与模式)由大算力实验室主导,而后训练(任务、环境、反馈、奖励)是一场更开放的竞赛。Affine(Bittensor 子网)正是把后训练中的一环变成了持续的公开竞赛。
「模型」频道最新
- 如何微调模型去除“废话”?实战经验分享 — ivan_bezdomny · 2026-08-25
- 传闻中的超大上下文新模型:创企将用神经算子架构发布 — McDonaghMatthew · 2026-08-25
- 前 NVIDIA 科学家创企发布物理预测模型,单次处理 5 万亿数据点 — thesaraharminta · 2026-08-25
- OpenAI披露:用Codex两个月将三个开源模型调至高性能 — eliebakouch · 2026-08-25
- 用户发现 Codex 用量疑似被静默重置 — kevinkern · 2026-08-25
- Arav Srinivas:端侧模型处理敏感文档至关重要,OCR 性能达 SOTA — AravSrinivas · 2026-08-25