实锤可用:logprob 门控让本地医疗实时速记 SKIP 判别达零误杀
r-chop14 · reddit · 2026-10-07
一位开发者受近期 Jev 语音门控讨论启发,把自己的本地门诊实时速记系统改造成带语义门控的实时工作流,并给出完整细节:
- 流水线:TEN-VAD 做语音分段送入 Whisper 兼容后端(0.6B 医疗微调 STT),CAM++ 说话人嵌入做尽力而为的说话人分离。
- 门控设计:每段话交给小模型做一次解码,取首 token top logprobs,把 SKIP/NOTE/ACT 三类概率质量加总分类;SKIP 缓冲不立即送主模型,下次唤醒时补入,另有 45 秒/40 词的去抖兜底防漏记;主模型带工具可实时修改病历笔记,且依赖 prompt cache 保持低延迟。
- 关键发现:4B 模型几乎从不判 SKIP;仅靠概率质量分类与直接 prompt 生效差不多(约 81% 准确率)。深挖 logprobs 后找到有效信号——「选了 NOTE、P(SKIP)≥0.05 且句子 ≤8 词」几乎总是 SKIP。加上这条启发式后,多轮测试零误杀 SKIP,SKIP 召回率从 0-50% 提升到 75-100%。
- 对比测试:在约 40 条人工标注的自然门诊录音上,Jev 与该方案都是 95% 准确率,但延迟 73ms vs 514ms(后者为远程端点);在指令密集的合成脚本上 Jev 落败(约 80% vs 100%)。作者提醒启发式在训练集上调优,需 held-out 集确认。
结论:首 token logprob 单次分类虽是老技术,但叠加轻量启发式后,在延迟不敏感的前提下比直接让小模型输出分类可靠得多。
「编程与Agent」频道最新
- Hermes Gadget SDK 开源三天,社区把它跑上手表、旧安卓手机等各类设备 — Teknium · 2026-10-07
- Glasser 聚合 1558 个数据 API,让 AI Agent 按次付费取数 — goyalshaliniuk · 2026-10-07
- MIT 论文:极简 agent 循环靠「历史即变量」胜过专用记忆系统 — rohanpaul_ai · 2026-10-07
- 全 Rust 端到端生成 7 分钟 3Blue1Brown 风格讲解视频 — doodlestein · 2026-10-07
- Netlify AI Gateway 示例:一个 Function 直接返回 Nano Banana 生成图 — thisiskp_ · 2026-10-07
- Opus 5.5 搭出难看的「黑盒 slop 算法」,性能却大幅领先人类 — burny_tech · 2026-10-07