26B 扩散模型加 512 token 推理预算,推理时扩展即反超基线

rickasaurus · x · 2026-09-21

开发者 pomterree 尝试给 DJev 增加 decode 阶段的推理时扩展:给默认为 0 的 think 旋钮加上 512 token 预算,让模型在返回结构化结果前先推理。作者称调优后的 26B 扩散模型借此轻松击败了 Jev,并在此前的各主要 Jev 变体横评中 DJev 本就名列前茅。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →