AWS 论文被 COLM 接收:8B 模型靠 GRPO 超越大模型

AWS Trainium 实验室合作提交的一项研究被学术会议 COLM 接收,并取得前 5% 的顶尖评分。该论文提出了一种简单有效的方案:对思考与代码 token 采用分段级奖励,结合 GRPO、课程学习和稳健验证器进行训练。这一方法成功让一个 80 亿参数(8B)的小模型在表现上超越了更大规模的模型。

2026-07-09 ~ 2026-07-09 · 2 条相关