riderless:零生成 token 的决策 API,单张 5090 跑出 93.1% 准确率
Pale-Soil-2524 · reddit · 2026-09-22
作者开源了 riderless(Apache-2.0),验证一个假设:不需要专门训练的决策模型,普通指令微调模型只要停止生成、直接读 logits 就能做分类决策。
核心做法
- 基于 Gemma 4 26B-A4B,用 FastAPI 包一个 llama.cpp 子进程
- 每个问题编译成答案必须是单个字母的 prompt,只跑 prefill,最终答案取 A-Z 标签 logits 的 softmax
- 返回完整概率分布而非解析后的字符串,零生成 token
单张 RTX 5090 实测(Unsloth UD-Q4KXL GGUF)
- 7 套手写测试集共 1,286 题(抽取、论断支持、记录匹配、护栏门控、层级分类、重排、工具选择),准确率 0.931
- 顺序模式中位延迟约 180 ms;批量模式降到约 108 ms,代价是损失 5-6 题准确率
- 跨问题污染探针为 0.0
横向对比:同套件下 Kev-9B 得 0.898,Laya typed-decisions 0.618,so1 分离模式 0.921、打包模式 0.901——prompt 与读出方式的差异只值一两个点,打包问题损失约两个点。作者注明均为单次运行、自建合成套件、无置信区间。
「编程与Agent」频道最新
- Grounded Document Agent:长 PDF 问答带页码引用,全本地跑通 — Roger_M_Taylor · 2026-09-22
- Synara v0.9.0 将 Computer Use 带入 macOS 原生应用 — CurieuxExplorer · 2026-09-22
- Jev 工程实测:毫秒级决策层让 300 Agent 集群快 193 倍省 444 倍 — Roger_M_Taylor · 2026-09-22
- scikit-learn 联创等将直播对谈:智能体数据科学哪些已落地 — hugobowne · 2026-09-22
- Pi 官方不做 Sub-agent,社区涌现 5 款 Agent Team 插件 — solyarisoftware · 2026-09-22
- Pi v0.87.0 发布:会话上下文可直接编辑,含 5 处破坏性变更 — solyarisoftware · 2026-09-22