新开源 TTS:Scylla's Band
clockentyne · reddit · 2026-07-20
一个名为 Scylla's Band 的新 TTS 模型与推理框架开源了,附带 Android 示例应用。
作者给出的要点包括:
- 支持 10 种声音、7 档情绪/情感参数、3 种语言(英语、西语、意语)。
- 在 Samsung Fold 7 上首段音频延迟约 500–800ms,之后可连续流式输出。
- 代码与推理栈覆盖 Linux、macOS、Android,并测试了 M 系列 Mac 和 Android 设备。
- 他们没有用 eSpeak,而是自建数据集并训练了 G2P 模型,还自己做了 C++ 文本规范化和 ONNX/LiteRT 推理优化。
作者还提到未来想扩展更多语言、增强情感控制、补 iOS 示例,但暂时不承诺。
「具身」频道最新
- 奥兰多 Robotaxi 用 Model Y 无人监督上路 — aelluswamy · 2026-07-21
- Anthropic 与 Physical Intelligence 曾谈早期并购 — steph_palazzolo · 2026-07-21
- EPO 用边缘对齐同时优化 3D 模型位姿与深度 — ducha_aiki · 2026-07-21
- Applied Intuition 推出 Dana,谈把智能装进十亿台机器 — a16z · 2026-07-21
- 助听器拥抱 AI:Auracast 与 OmegaAI 重塑个人音频广播 — BrandonSawalich · 2026-07-21
- a16z 播客对话 Applied Intuition:具身智能与物理 AI 的下一个十年 — a16z Podcast · 2026-07-21