600M 模型浏览器内 160ms 分类语音备忘,全程不上传
iamrobotbear · x · 2026-10-09
LiquidAI 实验性模型 d1-omni-600M(融合 LFM2.5-Encoder-350M 与视觉/音频编码器)被用于一个语音备忘自动归档 demo:把你说的话在约 160ms 内分类为提醒、清单、消息、旅行、问题或音乐,完全在浏览器内通过 WebGPU 运行。
它不生成转录文本、不产出任何生成内容,只输出结构化 JSON,语音数据不离开当前标签页。官方称该模型在毒性检测与复述识别的文本基准对比中领先,适合语音命令路由、端侧审核与意图分类。提供在线 demo 与 ONNX(文本+视觉+音频)下载。
「Infra」频道最新
- 腾讯开源 STEPQuant:6-bit 递归状态省 68.7% 推理内存不失精度 — _akhaliq · 2026-10-09
- Bain 预测 2030 年全球 GPU/定制芯片出货 3860 万片,为 2023 年 10 倍 — Beth_Kindig · 2026-10-09
- 多团队共享 GPU 集群:AWS 发布 HyperPod 多租户参考架构 — AWS ML Blog · 2026-10-09
- Mistral 被指弃用核电转用七成煤电数据中心训练开源模型 — wavefnx · 2026-10-09
- 为什么每轮都把完整对话发给推理服务器?Reddit 热议服务端 KV 槽位 API 设想 — Vasili_Sk · 2026-10-09
- NVIDIA NeMo-DCR:1T 模型权重同步从 87.5 分钟压缩到 150 秒,提速最多 40 倍 — dair_ai · 2026-10-09