开源 2.9B 参数 TTS 模型 TontaubeV1,采用字符级分词
EAVDR · reddit · 2026-09-01
TontaubeV1 是一个基于 Qwen3-1.7B 的 2.9B 参数开源 TTS 模型,专注于表现力强的长文本生成和低延迟本地推理,支持英德语及零样本声音克隆。该项目采用了两项非主流设计:
- 字符级分词:强制模型将文本视为字符序列处理,发现比 BPE 分词效果更好,减少了未见过的 token 组合导致的分布外问题,且保留了语言理解能力。
- 独特的分块与位置编码:将文本、语义音频和声学码本序列视为多行并行数据流,通过逻辑位置 ID 将相同时间帧的 token 对齐。使用配对的分割标记防止位置泄露,并通过滑动窗口保持长文本上下文。
「模型」频道最新
- Arena 榜单:Qwen3.8-Max-0902 编程成绩超越 Claude Opus 5 — yogthos · 2026-09-03
- 无视觉能力的 GLM 5.3 把图片转 ASCII 画来读图,工程味拉满 — _AndrewZhao · 2026-09-03
- Gemini 3.8 Flash 实战艾尔登法环:通关 Radahn boss 战,视角操控仍欠火候 — No-Elderberry-7785 · 2026-09-03
- Sebastian Raschka 拆解 The Information 的 OpenAI Astra「循环Transformer」传闻 — rasbt · 2026-09-03
- Gemini 3.8 Flash、Muse Spark 1.3 接连现身,DeepSWE 被碾压 — zainhas · 2026-09-03
- Qwen3.8-Flash-Next 本地量化版频现「幻觉式报错」:坚称上下文已损坏 — arkham00 · 2026-09-03