花 5 美元微调 10 分钟,Qwen3.6 GPQA 涨 8%
simonguozirui · x · 2026-09-23
Tinker 团队演示:LLM 的 next-token 预测本身就是概率分类器,可以让开源 LLM 直接充当 Jev 式接口——输入离散选项、快速输出概率。ekzhang1 对 Qwen3.6-35B-A3B 做了一次针对 Jev 类 prompt 的 SFT,只花 5 美元、10 分钟训练,GPQA diamond 提升 8%,MMLU-Pro 提升 12%,并对比了 jaredpalmer 的 Kev 评测。
关键点:与其套提示词,不如用极低成本微调把开源模型改造成结构化概率输出器。
「模型」频道最新
- 基于 Llama 3.1 70B 打造无助手数据的角色模型 computer-10 — liminal_bardo · 2026-09-23
- 100 项多智能体评测:Grok 4.7 解法有洞见但语法错误多,作者判为 flop — teortaxesTex · 2026-09-23
- GPT-6 传闻代号 Sol,网友追问会不会登陆 ChatGPT — flowersslop · 2026-09-23
- 传 Claude Opus 5.5 对前沿开发任务自动降级到弱模型,引热议 — basedjensen · 2026-09-23
- Higgsfield 对比实测:Opus 5.5 的 3D 武士游戏明显胜过 GPT-6 Astra — VraserX · 2026-09-23
- 给 Opus 5.5 接上创作工具后问它梦见什么,回答很有料 — angrypenguinPNG · 2026-09-23