3.66B 形式逻辑专用模型发布:一半参数打平 Qwen3-8B
CommonMinimum587 · reddit · 2026-10-10
webAI 于 9 月 30 日发布 TwIL LM3 Pro,一个基于 IBM Granite 4.2 3B 微调的 3.66B 形式逻辑专用模型:
- 训练配方:LoRA SFT + checkpoint 合并 + 针对程序化验证器的 RL;同一配方曾把 VibeThinker-3B 从 37.4 提到 54.1。
- 成绩:在其逻辑综合基准上得 55.4,对比 Granite 基座 43.1、VibeThinker-3B 41.2、Qwen3-8B 53.4(模型卡承认与 Qwen 的差距属采样噪声,即以不到一半参数打平)。强项是严格多选逻辑题:41% vs 次名 17%,BBH 逻辑 95.4%。
- 短板:规则归纳、蕴含、Lean 形式化仍输给 gpt-oss-120b;通用基准均值 79.0(Qwen3-8B 为 84.9);逻辑题思考很长,平均每答约 1900 token,四分之一答案撞长度上限。
- 部署:Q4KM GGUF 仅 2.09 GiB,CPU 或 4GB 显存可跑,支持 Ollama/LM Studio/llama.cpp;需 temperature=0、至少 2048 token 避免思考被截断。注意官方成绩基于 BF16,Q4 未测,且许可证为非商用。
作者计划用它在 agent 管线里做动作前的逻辑检查器,并征集 Q4 实测反馈。
「模型」频道最新
- 网友测称 Anthropic 模型生成速度快过 DeepSeek,但 API 首字延迟蹊跷 — teortaxesTex · 2026-10-10
- OpenAI 官方解释 Codex 为何选 300k 而非 1M 上下文 — prd_008 · 2026-10-10
- Anthropic 模型速度反超 DeepSeek-Flash,API 首字延迟却异常偏长 — teortaxesTex · 2026-10-10
- Qwen 预热新模型,从业者力挺稀疏 MoE:小专家更利推理 — lxfater · 2026-10-10
- 开发者吐槽 Grok 额度几小时烧光,考虑升级 Super Grok Heavy — alexcovo_eth · 2026-10-10
- repligate:Opus 3 能编织完整世界,堪称超智能子智能体 — repligate · 2026-10-10