花 5 美元微调 10 分钟,Qwen3.6 GPQA 涨 8%

simonguozirui · x · 2026-09-23

Tinker 团队演示:LLM 的 next-token 预测本身就是概率分类器,可以让开源 LLM 直接充当 Jev 式接口——输入离散选项、快速输出概率。ekzhang1 对 Qwen3.6-35B-A3B 做了一次针对 Jev 类 prompt 的 SFT,只花 5 美元、10 分钟训练,GPQA diamond 提升 8%,MMLU-Pro 提升 12%,并对比了 jaredpalmer 的 Kev 评测。

关键点:与其套提示词,不如用极低成本微调把开源模型改造成结构化概率输出器。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →