用 100 道 zebra puzzle 微调 Qwen3 4B,MATH-500 提升 31%
TGSCrust · reddit · 2026-09-11
作者在 Hugging Face 发布了 pcss 复现博客:仅用 100 道 zebra 逻辑谜题对 Qwen3 4B Base 做微调,即在 MATH-500 上取得 +31% 的提升,且训练只需单张 H100/H200 跑 6.5 分钟。
亮点在于极低的成本门槛:配套提供了完整可复现的 notebook,任何人都可以在单卡上验证这一结果,展示了小规模高质量推理数据微调对小模型数学能力的放大效应。
「模型」频道最新
- V4.1在LiveBench排第5,Agentic Coding登顶但被指语言偏科 — teortaxesTex · 2026-09-11
- OpenAI 发布 GPT-Live 提示词指南:照搬旧提示词难以发挥 SOTA — craigsdennis · 2026-09-11
- 用户吐槽 GPT-6 Astra 一周额度一次用光,周一前无法继续干活 — max_paperclips · 2026-09-11
- Wiz发布Cyber Model Arena:Gemini 3.8 Flash Cyber以74.9%居首 — rseroter · 2026-09-11
- Anthropic 宣布 Claude 不再向未成年人开放 — petrusenko_max · 2026-09-11
- V4.1 冲上 LiveBench 第五:Agentic Coding 登顶,比 Astra 高 20 分 — teortaxesTex · 2026-09-11