NYU 团队新论文:无监督发现 6 种模型风格,风格影响推理正确率
kchonyc · x · 2026-10-04
Ioana Marinescu、Eric Oermann 与 Kyunghyun Cho 发布预印本《Reason in Style: Discovering and Controlling Style in Language Models》。
核心发现
- 语言模型联合学习内容与风格,输出中的风格变化通常难以识别和控制。作者设计算法将模型输出表示中的内容与风格分离,无需监督即可发现重复出现的风格。
- 对来自 9 个不同教师模型的 10 万多条已验证推理轨迹进行分析,共发现 6 种反复出现但分布不均衡的风格。
- 通过重要性加权平衡各风格后微调小模型,使其能按指定风格作答;在 6 个数学推理 benchmark 上 Pass@k 均优于用相同数据的标准微调。
- 风格确实影响正确率:解题概率随所条件化的风格而变化,且不同题目受益于不同风格。
结论:模型生成数据中的风格差异可以被无监督地发现并显式控制,这既是控制手段,也是提升推理性能、多样化数据风格的来源。
「研究」频道最新
- arXiv论文:自改进分支混合优化Agent Harness,奥数相对提升34.8% — rohanpaul_ai · 2026-10-04
- Meta等新论文:分支化自优化让Agent Harness精度大增 — rohanpaul_ai · 2026-10-04
- Claude 子智能体做数学研究,遇到雅可比猜想反例先质疑再验证 — repligate · 2026-10-04
- Richard Sutton 推荐:新博士论文让机器人部署后边用边学 — RichardSSutton · 2026-10-04
- 港中文 TimePrism 中选 ICLR 2026:概率预测从采样转向场景生成 — jiqizhixin · 2026-10-04
- RL 智能体调度 LLM 群探测暗物质信号,AI for Science 新论文 — DanielWhiteson · 2026-10-04