stuntd 0.1.2:本地小头替模型做决策,最弱字段决定省多少调用
Inevitable-Log5414 · reddit · 2026-10-01
作者发布开源代理工具 stuntd 0.1.2:学习你 LLM 应答中的类型化决策(如工单分类),置信度高的问题由 20ms GPU / 60ms CPU 的本地小头直接回答,其余才调用大模型。
- 多字段决策的新设计:0.1.2 支持多字段输出(如 category + urgency + needshuman)。作者否掉了「每个字段各自本地回答」方案——反正都要付整次模型调用,且半本地半模型的答案难调试;改为 all-or-nothing:只有所有字段都够置信才本地作答,否则交给模型并把结果作为训练数据。
- 反直觉发现:在客服 demo 上,三个字段各自置信率分别为 99.9%、92%、76%,但三者同时置信只有 72.7% ——本地命中率由最弱的那个字段决定。
- 新增能力:autoretrain 在攒够 N 条新捕获后自动重训,新头先以 shadow 模式旁路运行,与模型长期一致才切换上线,效果下滑自动回退;支持 Anthropic Messages 格式学习,以及 serve --lazy 惰性模式。
代码在 GitHub(bladedevoff/stuntd),Hugging Face Space 可直接试用。
「Infra」频道最新
- RAG 与 RL 工具调用让 CPU 回归 ML 训练,或需专用 CPU 节点 — StasBekman · 2026-10-01
- CXMT 拟投 52 亿美元扩产 DRAM,93% 研发预算用于国产设备 — pstAsiatech · 2026-10-01
- Cloudflare 生日周第三天:Agent 主题连发六项新功能 — threepointone · 2026-10-01
- 分布式算力市场新上 10 个 B300 节点,可按单节点起租 — markjeffrey · 2026-10-01
- 27B 模型 Q5 量化+131k 上下文塞进单张 24GB 3090,提速 13-17% — bjivanovich · 2026-10-01
- netkit 论文:容器网络跨 namespace 吞吐损失高达 31% — tianyin_xu · 2026-10-01