Phil Schmid 实操教程:用 Gemini 3.8 TTS 复刻你自己的声音
_philschmid · x · 2026-09-24
Phil Schmid 发布教程,讲解如何用刚上线的 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 复刻自己的声音或凭一句话创造新声音。这两个模型已在 Gemini API 和 AI Studio 提供,登顶 Hume Voice Design Benchmark,并在 Voice Arena 六种语言中排名第一。
教程要点:
- 录制两段音频样本:同一麦克风、同一房间、24kHz 单声道,不要中途换设备
- Linux 下用 -f alsa -i default 录音;macOS 首次运行可能只弹出麦克风权限弹窗,授权后重跑即可
- 同意声明必须是 25 种支持版本之一,需逐字朗读(如德语版本)
- 文中给出完整可复用 prompt,可直接丢给自己的 agent 执行
「多模态」频道最新
- Gemini TTS 发布会现场:可提示词控声,寿司翻译成亮点 demo — jocarrasqueira · 2026-09-25
- HuggingChat ML Intern 一条提示词 75 分钟自动训完 LoRA — Gradio · 2026-09-25
- Gradio 上线 LoRA 视角编辑 Demo,25 秒生成新视图附评测 — Gradio · 2026-09-25
- AI 视频即游戏引擎:PixVerse R2 用单一因果主干实时生成世界 — future_coded · 2026-09-25
- 视频生成加“micro expressions”提示词,角色情绪更细腻 — R34vspec · 2026-09-25
- 用户用 Opus 5.5 为旧素材生成音乐视频,效果获好评 — repligate · 2026-09-25