Google 发布 Gemini 3.8 TTS:2000+ 声音可克隆,1分18秒仅 2.74 美分
rseroter · x · 2026-09-24
Google 发布两款新文本转语音模型 gemini-3.8-flash-tts 和 gemini-3.8-flash-lite-tts,主打低价与多角色对话生成。
- 内置 2000+ 预置声音,还可用 30 秒音频样本克隆自定义声音
- API 便于定义多角色对话,每个角色可用不同声音和语气指令
- Simon Willison 用 GPT-6 Astra vibe coding 了一个自带 API key 的开源 Playground(利用 Gemini API 的开放 CORS),支持单声道旁白与多说话人对话编排、音频预览、可分享 URL
- 实测:用 Flash TTS 生成 1 分 18 秒音频耗时约 20 秒,成本仅 2.74 美分;脚本由 Claude 4.5 Opus 撰写,演示了两只鹈鹕辩论是否搬去 Pacifica Pier
所属事件:Google 发布 Gemini 3.8 Flash TTS 双模型,30 秒克隆声音(27 条相关)→
「多模态」频道最新
- 开源数据集 FineVision 获 NeurIPS 接收:17M 图、200 余源 — andimarafioti · 2026-09-25
- MiniMax H3 疑似「微笑过拟合」: bored 毛毛虫视频翻车实录 — episodex86 · 2026-09-25
- 浏览器端 3D 姿势编辑器 Pose Blueprint 开放测试 — OkConfusion6667 · 2026-09-25
- Reddit 用户仅调步数与 CFG 探索 AI 绘画的独立表达 — Extreme_Nice · 2026-09-25
- 不到 20 美元训练的 LoRA 让 Qwen-Image 单图转视角 — ben_burtenshaw · 2026-09-25
- Lingbot World v2 跑到 60 FPS,世界模型或重塑游戏开发 — bingxu_ · 2026-09-25