26B 扩散模型加 512 token 推理预算,推理时扩展即反超基线
rickasaurus · x · 2026-09-21
开发者 pomterree 尝试给 DJev 增加 decode 阶段的推理时扩展:给默认为 0 的 think 旋钮加上 512 token 预算,让模型在返回结构化结果前先推理。作者称调优后的 26B 扩散模型借此轻松击败了 Jev,并在此前的各主要 Jev 变体横评中 DJev 本就名列前茅。
「模型」频道最新
- 用户实测:Astra 变快且更省 token,疑 OpenAI 后台调整 — McDonaghMatthew · 2026-09-21
- 阶跃星辰发布 Step 5 Preview:600B MoE 27B 激活,百万上下文 — realmrfakename · 2026-09-21
- Ling 3.0 Tiny 对比 Gemma 26B:显存小 3 倍,任务准确率却腰斩 — autonoma_2042 · 2026-09-21
- 两人小实验室开源 27B 写作模型:EQ-Bench 4 得分 1330 — lukinator644 · 2026-09-21
- Hamel Husain 回应 rasbt:说 LLM 是分类器没错,但别用「只是」 — HamelHusain · 2026-09-21
- 开发者观点:零样本演示不能衡量模型智能 — brandon_galang · 2026-09-21