CogEvol单次生成可运行课件,27B在HTML-500拿63.7且零硬失败

CogEvol: Towards Efficient and Reliable Learning Environment Generation

Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang, Huiqiang Rong, Mofei Chen, Shen Yang, Yini Chen, Yinuo Duan, Haoxuan Li, Binglin Liu, Ye He, Danqi Zheng, Zhanxin Hao, Yuxuan Wu, Mengting Tao, Yuqiu Liu, Jifan Yu, Juanzi Li, Bin Xu, Lei Hou, Huiqin Liu, Yu Zhang

cs.CL, cs.AI

2026-08-31

清华与CogEvol把课件做成单次生成:生产中位十七秒出幻灯片、五十九秒出交互页;二十七B在HTML-500得63.7,五百页里零硬失败。

这篇在解决什么

教室要的学习材料正在变成可运行的东西:符合渲染器合同的 JSON 幻灯片,以及自包含的交互 HTML(仿真、游戏、代码操场)。通用编程 agent 能做,但慢:论文测过的直连 API 编辑平均 152 秒,已有系统单次改动常要 200 到 600 秒。更麻烦的是好看不等于能用。幻灯片一旦字段名写错,生产渲染器直接硬失败;HTML 可以画面很满,按钮却是死的。旗舰编码模型还太大、太贵,撑不起规模化课件。

CogEvol 把这件事收成一个任务:Learning Environment Generation,一个 brief 进,一次调用出成品,不走多轮 agent。

方法

只有后训练。4B 从 Qwen3.5-4B 出发,27B 从 Qwen3.8-27B 的混合架构出发(48 层 GDN 线性注意力 + 16 层全注意力)。三阶段:混合 SFT 教两种输出合同,幻灯片 RL 教排版,HTML RL 教可玩性。

SFT 的 53687 条对话来自生产。幻灯片教师出图后要过解析、schema、生产渲染和多模态打分;HTML 从 119122 次生产生成里挖失败,Chromium 探针筛出 21.7% 硬失败,再重生并复跑。SFT 能把合同教到 99.2% 可解析,却抬不起交互质量,HTML 还随更新步数往下走。

RL 用 GRPO。幻灯片奖励 0.6 VLM 保真 + 0.4 几何规则(碰撞、出画、假图表)。HTML 奖励把视觉、内容、多视口和交互探针拆开计,硬失败直接零分。关键事故:旧奖励只看截图,游戏分在硬化后重打只有 18.8;加上常开探针和硬失败门后,游戏回到 57.6。原则被写成一句:交互必须被测量,不能只被看。

推理侧,scaffold editing 从约百万历史组件里检索模板,模型只出组件级补丁,内部测试输出 token 和延迟大约都降 76%。MAIC-UI 用点击定位加 unified diff,同骨干上平均编辑 6.3 秒,相对直连 API 的 151.7 秒大约 23 倍。服务还迁到昇腾 910 A3:应用层和 A800 打平(500/500 可解析),缺投机解码和栈差异让吞吐仍差一截。

结果

生产 22 万次请求:幻灯片中位 17 秒(P95 26),交互页 59 秒(P95 107)。内部套件上 CogEvol-27B:HTML-500 63.7、slide-std 83.7。Claude Opus 4.8 HTML 67.2 更高,但 500 页里 19 页硬失败;27B 是 0。GPT-5.4 HTML 66.0,13 页失败。Qwen3.8-Max 在 34KB 完整规格下幻灯片追平 83.7,HTML 只有 35.3,204/500 页是死的。人工抽测里不可用页从 25%(6/24)降到 10%(3/30),无法进入从 2/24 到 0/30。

4B 开源:HTML-500 61.7,slide-std 75.1。串行配方有遗忘税,27B 幻灯片从 84.8 降到 83.7,掉在排版上。评测套件不公开,HTML 打分器就是训练用的硬化奖励,且由 Qwen3.8 家族的 27B VLM 执行。

为什么重要

这是一份很少见的、带着生产流量和翻车记录的垂直后训练报告。对做教育生成或任何「必须能点」的 UI 生成,可迁移的是奖励设计:截图裁判会养出能看不能玩的页面,可执行探针才会把它打回去。27B 参数约为 GLM-5 的 1/26.9,API 成本按他们的公开标价测算比 Opus 和 GPT-5.4 低 15 到 22 倍,4B 还开了 Apache 2.0。

套件内部持有,和旗舰的对比不能当公开榜。HTML 上 Claude 仍略高,27B 赢在零硬失败和幻灯片合同,不是全面超过旗舰。

局限与存疑

没有独立局限节,正文里的保留已经够用。评测主题和打分器不发布,外部模型只能投稿 API,污染和过拟合难审计。HTML 裁判与 Qwen3.8-Max 同族,存在家族偏倚。人工测试 n=24 对 30,提示还不完全相同。语言混用和元素叠压在两轮人工里都还在,因为奖励没给这两项定价。HTML 语料 69.8% 是仿真、没有 3D 样本,SFT 偏差要靠 RL 补。昇腾路径上前缀缓存和投机解码会静默算错,因为 GDN 状态不可逆截断;应用层打平不等于服务吞吐打平(46.1 vs A800 生产 167.4 RPM)。

术语

原文与代码

相关论文

全部论文解读