同一底座后训练立功:GLM-5.3 Terminal-Bench 从 4.6% 飙到 28.3%

bittingthembits · x · 2026-08-25

GLM-5.3 与 GLM-5.2 使用相同基座模型,仅通过扩大后训练(更多环境、更多样任务、更多算力)将 Terminal-Bench 3.0 的任务解决率从 4.6% 提升到 28.3%,约 6 倍跃升。Terminal-Bench 测试 agent 在真实终端环境中完成复杂任务的能力。

发帖者借此说明:预训练(学语言、代码与模式)由大算力实验室主导,而后训练(任务、环境、反馈、奖励)是一场更开放的竞赛。Affine(Bittensor 子网)正是把后训练中的一环变成了持续的公开竞赛。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →