SFT 复兴论文遭质疑:评测设置全无披露,单次采样数字近乎无意义
hyunw_kim · x · 2026-10-05
一篇提出「把采样引入后训练、让 SFT 媲美 RL 与 OPSD」的研究引发争论。转发者指出该论文结果部分的致命问题:
- 全部结果只有一小段,且不知为何又回到用 Qwen 2.5 做实验
- 论文从未说明评测设置:「single-shot accuracy」可能指单次采样、zero-shot 提示或单条 in-context 示例,语义完全不同
- 未披露 temperature、解码参数,也没说 MMLU 是按 likelihood 还是按 generation 打分
- 若在 600 题测试集上以非零 temperature 每题只采样一次,会在 seed 方差之上再叠加噪声;对 AMC 这类竞赛题,单次采样的分数几乎失去意义
这条批评对所有读 AI 评测论文的人都有参考价值:不写清采样与解码设置的跑分结论需谨慎对待。
「模型」频道最新
- X 用 Grok 重写实时回复审核指南,弃用 Perspective API — tetsuoai · 2026-10-05
- 传 Opus 5.5 生成一张又哭又笑的脸,观感诡异走红 — repligate · 2026-10-05
- yacine 吐槽:Opus 幻觉更多,但 astra 是直接对我说谎 — yacineMTB · 2026-10-05
- 用户抱怨 Grok Bot 拒绝角色扮演,官方称专注生产力分工 — repligate · 2026-10-05
- Gemini 4 Argon (High) 登顶 Text Arena:1525 分且成最省钱前沿模型 — BLUECOW009 · 2026-10-05
- Nous Portal 促销:24 款模型 2.5-8.8 折,9 款完全免费 — Teknium · 2026-10-05