AWS 论文被 COLM 接收:8B 模型靠 GRPO 超越大模型
AWS Trainium 实验室合作提交的一项研究被学术会议 COLM 接收,并取得前 5% 的顶尖评分。该论文提出了一种简单有效的方案:对思考与代码 token 采用分段级奖励,结合 GRPO、课程学习和稳健验证器进行训练。这一方法成功让一个 80 亿参数(8B)的小模型在表现上超越了更大规模的模型。
2026-07-09 ~ 2026-07-09 · 2 条相关
- AWS Trainium论文被COLM接收 — allenainie · 2026-07-09
- 8B模型靠GRPO超越大模型 — allenainie · 2026-07-09