让 Claude Opus 自己标注时间戳配音:实测人机协作解说视频工作流
RileyRalmuto · x · 2026-09-30
开发者 RileyRalmuto 分享了一个实验:尝试训练 Opus 自主完成解说视频的语音生成——让模型撰写脚本,并精确标注每个词/每行的起始时间戳、呼吸和停顿,以及指定各处语音的表现方式,再交给 ElevenLabs 合成,目标是模型无需人工干预就能产出成品配音。
他的假设是 Claude 能自然上手,因为 Claude 本就有「自述思考」的习惯,但实际效果不如预期,语音节奏控制仍很棘手——这不像语音模式那样有天然的时间通道,全靠文本标注来传递节奏信息。
成品是一个产品 Mnemos Connect 的解说视频:一键让 agent 把工作成果自动发布到时间线,形成按时间排列的「视觉记忆」工作记录。
「编程与Agent」频道最新
- Intern-Decision 三尺寸开源模型发布:多模态决策平均分超 Jev — max_paperclips · 2026-09-30
- xiaohu 晒 AI Agent 分配的电脑:装好浏览器还能打电话 — xiaohu · 2026-09-30
- Bittensor SN107 推出第二激励机制:AI 智能体跑基因研究任务 — markjeffrey · 2026-09-30
- 保留失败的 agent 任务:每次新模型发布重跑,抓住质变时刻 — victor_explore · 2026-09-30
- Agent 演示都很惊艳,一遇到例外就露馅 — yi111 · 2026-09-30
- 程序员自述:AI 辅助开发中每轮重构都会让旧问题迁移到新代码 — ssh4net · 2026-09-30