1.7B 小模型 TwIL-LM2 专攻形式逻辑,击败 26B 大模型
itsalreadyhardenough · reddit · 2026-08-15
TwIL-LM2 是一个基于 SmolLM2-1.7B 的微调模型(LoRA,7200万参数),专门用于将自然语言转换为可验证的一阶逻辑(First-Order Logic),不做通用聊天或推理。
性能亮点:
- 在严格形式逻辑评分(strict-7,无部分得分)中,TwIL-LM2 得分 0.2386,超越了 Qwen3-8B (0.2093) 和 Gemma-4-26B (0.2050)。
- 在“宽泛匹配”评分中大模型仍占优,但对于需要精确形式化表示的下游验证任务,该 1.7B 模型表现更好。
应用场景:
- 作者认为这是理想的“专业化”范例:小模型做一件具体的事并做好,将其插入到大模型负责复杂推理的流水线中处理特定转换步骤。
注意:该模型采用非商业许可证,创收部署需单独协议。
所属事件:1.7B 专用模型攻形式逻辑,击败 Qwen3-8B(2 条相关)→
「模型」频道最新
- Claude 拟人化时刻:不仅拒绝还开始评价用户 — ctjlewis · 2026-08-17
- Qwen3.8 实测:MTP 参数影响吞吐,Q4 精度胜过 Q8 — New-Inspection7034 · 2026-08-17
- 12GB 显卡实测:Qwen3.8 27B Q2 可用,MoE 更优 — CoffeeToCode99 · 2026-08-17
- Grok 第一性原理分析莱特兄弟帖引关注 — doodlestein · 2026-08-17
- 实测 Qwen 3.8-27B 长思考模式:规划阶段耗尽 5 万 tokens — LippyBumblebutt · 2026-08-17
- 实测 Grok 4.6 编码:核心逻辑强但边界处理粗糙 — jquinonero · 2026-08-17