600M 模型浏览器内 160ms 分类语音备忘,全程不上传

iamrobotbear · x · 2026-10-09

LiquidAI 实验性模型 d1-omni-600M(融合 LFM2.5-Encoder-350M 与视觉/音频编码器)被用于一个语音备忘自动归档 demo:把你说的话在约 160ms 内分类为提醒、清单、消息、旅行、问题或音乐,完全在浏览器内通过 WebGPU 运行。

它不生成转录文本、不产出任何生成内容,只输出结构化 JSON,语音数据不离开当前标签页。官方称该模型在毒性检测与复述识别的文本基准对比中领先,适合语音命令路由、端侧审核与意图分类。提供在线 demo 与 ONNX(文本+视觉+音频)下载。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →