零视频模型:Claude Opus 5.5 纯写代码产出 50 镜头手绘风 MV
DigitalDaydreamers1 · reddit · 2026-09-25
Reddit 用户给 Claude Opus 5.5 一首 Suno 生成的 MP3 和十几条简短美术指令,让模型全程用代码(不调用任何图像/视频生成模型)做出一支约 50 个镜头的手绘风格音乐视频。
模型做了什么
- 分析音频的节拍、节奏、能量和 32 频段频谱,并从 MP3 元数据读出歌词;安装离线语音对齐工具,把每个歌词词与 vocals 对齐,让剧情卡在对应歌词上
- 写出故事:凌晨 3 点失眠者的思绪化作霓虹小生物,被歌曲哄睡;共 9 章、约 50 个镜头,剪切点全部贴合节拍
- 读取并改编开源 WebGL 笔触渲染器(Joshua Ledbetter 的 functional-emotions-video,MIT 协议),融合 synthwave 风格
- 所有角色、道具、场景均程序化绘制;应要求把画面上的歌词替换为无文字符号
亮点与限制
- 它在沙箱里跑起 headless browser 自检渲染帧,自己发现并修掉了太阳过曝、汽车被粉色网格吞没、尴尬姿势、镜头出画和多次崩溃——没人提示
- 无 GPU,软件渲染 4698 帧 1080p30,耗时 2 小时余;沙箱重启两次都能从上次保存帧恢复
- 限制:视觉风格基于现成开源渲染器;长渲染仍需人工喊「continue」;vocoder 重的 vocals 歌词对齐偶有偏差;风格化程序动画而非写实
作者感叹:一年前这需要懂 WebGL、音频分析和动画的人做一周,现在只是一场对话。
「编程与Agent」频道最新
- Cursor 团队放出自家心得 prompt:专治 agent harness 的 token 浪费 — _AustinCalvert_ · 2026-09-25
- 开发者计划用 Claude 向所有以太坊客户端提交约 150 个 PR — banteg · 2026-09-25
- 博主用 5 台 DGX Spark 搭本地推理集群,跑多智能体分工协作 — natesiggard · 2026-09-25
- familiars 上线交易硬规则:服务器端强制执行风控 — econoar · 2026-09-25
- 开发者质疑 Codex 暗加 OpenAI 云沙箱部署指令并抢占优先级 — natesiggard · 2026-09-25
- LangSmith 推出微调服务,联合 Fireworks 与 Baseten 后训练开源权重模型 — hwchase17 · 2026-09-25