用单次前向表现近似预训练质量

RyanGreenblatt · x · 2026-07-17

Ryan Greenblatt 先说自己之前链接错了,随后补充:他用某个数据集做了快速实验,并以**单次前向推理的数学题表现**作为一个近似指标。 他解释这个指标并不完美,但能大致对应预训练质量;至少它不会被后训练改善。相比之下,loss 可能更好,但由于拿不到闭权重模型的 base,无法直接测 loss。

所属事件:研究者提出用数学单测评估预训练质量(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →