大模型 RL 蒸馏小模型的隐忧:能力校准缺失致过度自信

willcb · x · 2026-10-05

willcb 指出「大模型 RL 训练后直接蒸馏到小模型」这一常见范式的一个结构性问题:

结论:蒸馏不应是终点,小模型需要补充 RL 来重新校准自身能力边界。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →