SFT 复兴论文遭质疑:评测设置全无披露,单次采样数字近乎无意义

hyunw_kim · x · 2026-10-05

一篇提出「把采样引入后训练、让 SFT 媲美 RL 与 OPSD」的研究引发争论。转发者指出该论文结果部分的致命问题:

这条批评对所有读 AI 评测论文的人都有参考价值:不写清采样与解码设置的跑分结论需谨慎对待。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →