开源音频模型可搜索阿波罗11录音
BanghuaZ · x · 2026-07-12
Open_MOSS 发布了 **MOSS-Transcribe-Diarize**,一个 **0.9B** 的开源模型,采用 **Apache 2.0** 许可证。 这个模型把 **转写(transcribe)**、**说话人分离(diarize)** 和 **时间戳标注(timestamp)** 合并到单次处理里,核心优势是适合**长音频输入**。 文中给出的实测案例是: - 用它把 **174 小时** 的 **Apollo 11** 任务音频整理成可搜索内容 - 总成本只有 **$9.46** - 使用的是互联网档案馆保存的原始 NASA 录音 - 共处理 **103** 段音频 - 通过一次 Hugging Face Job 完成,耗时 **3.8 小时**,速度约 **47x realtime** - 最终生成 **45,355** 个带时间戳的说话片段 作者还表示,现在可以按“谁在什么时候说了什么”来搜索这批任务录音。
所属事件:Open_MOSS开源语音模型可检索阿波罗录音(2 条相关)→
「多模态」频道最新
- 创作者称用 Adobe Firefly AI Assistant 完成整支短片导演 — LudovicCreator · 2026-07-21
- Reddit 实测:Krea 2 Turbo 用绕过 LoRA 找回表情能力 — YentaMagenta · 2026-07-21
- Suno v5.5、Reason Studios 和 Grok Imagine 拼出 AI 音乐梗作 — Kyrannio · 2026-07-21
- AI 动漫创作被拆成可复用的提示词工作流 — Aiden_Tech_Ai · 2026-07-21
- Claude 被包装成免费生成爆款 Shorts 的工作流 — Aiden_Tech_Ai · 2026-07-21
- Bittensor 游戏演示称两人 30 天做出可玩 3D 世界 — markjeffrey · 2026-07-21