开源音频模型可搜索阿波罗11录音
BanghuaZ · x · 2026-07-12
OpenMOSS 发布了 MOSS-Transcribe-Diarize,一个 0.9B 的开源模型,采用 Apache 2.0 许可证。
这个模型把 转写(transcribe)、说话人分离(diarize) 和 时间戳标注(timestamp) 合并到单次处理里,核心优势是适合长音频输入。
文中给出的实测案例是:
- 用它把 174 小时 的 Apollo 11 任务音频整理成可搜索内容
- 总成本只有 $9.46
- 使用的是互联网档案馆保存的原始 NASA 录音
- 共处理 103 段音频
- 通过一次 Hugging Face Job 完成,耗时 3.8 小时,速度约 47x realtime
- 最终生成 45,355 个带时间戳的说话片段
作者还表示,现在可以按“谁在什么时候说了什么”来搜索这批任务录音。
所属事件:Open_MOSS开源语音模型可检索阿波罗录音(2 条相关)→
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11