用海量算力反复推演"意外样本",或可让模型学会反思

moultano · x · 2026-10-05

moultano 提出一个训练思路:当算力相对样本数量极高时,可以对每一个"令人意外"的样本做大量世界模型 rollout,找出能复现该意外的推演结果,再据此更新模型——相当于让模型"反复琢磨直到产生洞见"。这是对 test-time compute 与学习机制关系的简短思辨。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →