砍掉解码器直取 softmax:9B 模型本地跑出 100ms 概率输出

telltaleatheist · reddit · 2026-09-23

Reddit 用户 telltaleatheist 分享了一个本地工具 jev,思路是截断 qwen 3.5:9b 的解码(decoding)环节,直接获取 softmax 概率分布,并以 JSON 结构化形式返回 token 概率。作者称全程在本地系统运行,9B 模型响应速度约 100ms 且免费,还可调用模型的视觉塔分析图像。适用场景是需要拿到模型概率分布而非生成文本的应用。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →