开源音频模型可搜索阿波罗11录音

BanghuaZ · x · 2026-07-12

Open_MOSS 发布了 **MOSS-Transcribe-Diarize**,一个 **0.9B** 的开源模型,采用 **Apache 2.0** 许可证。 这个模型把 **转写(transcribe)**、**说话人分离(diarize)** 和 **时间戳标注(timestamp)** 合并到单次处理里,核心优势是适合**长音频输入**。 文中给出的实测案例是: - 用它把 **174 小时** 的 **Apollo 11** 任务音频整理成可搜索内容 - 总成本只有 **$9.46** - 使用的是互联网档案馆保存的原始 NASA 录音 - 共处理 **103** 段音频 - 通过一次 Hugging Face Job 完成,耗时 **3.8 小时**,速度约 **47x realtime** - 最终生成 **45,355** 个带时间戳的说话片段 作者还表示,现在可以按“谁在什么时候说了什么”来搜索这批任务录音。

所属事件:Open_MOSS开源语音模型可检索阿波罗录音(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →