实测 MiniMax H3:480p 下 BGM 消失,拉长片段时长才能找回
nakamep · reddit · 2026-08-20
作者对 MiniMax H3 做了 10+ 次对照实验:在 864x480 分辨率且提示词含对白时,模型完全不生成背景音乐;改写提示词、提高采样步数(20→30)都无效,唯一有效的是拉长片段——5s 升到 15s 后鼓点和和弦回来了(伴奏响度从 -38.7 LUFS 升到 -29.4)。但多加一句台词(约 2.5s 语音)就能抹掉三倍时长换来的 9dB 增益;去掉对白后 5s 也足够生成音乐(-25.0,甚至高于 720p 参考)。
测量方法可复现:用 demucs --two-stems=vocals 分离人声,对伴奏轨测综合 LUFS(响度)、频谱平坦度(0.094 噪声 vs 0.006 音调性音乐)与 onset 率(0.89/s 铺底 vs 4.97/s 鼓点),三项指标均与听感一致。环境音表现更差:观众低语、衣物摩擦声从未被渲染,只有与画面闪光绑定的单瞬态音效出现。官方指南的时间码指令有时灵有时不灵,无法预测:一次精确实现了 3.5s 镲、7.5s 鼓点中断、11s 乐队回归;另一次要求渐入却得到从最响处持续衰减。
「模型」频道最新
- Artificial Analysis 新榜:p0 质优价快优势扩大 — jeff_weinstein · 2026-08-20
- 语言学者感叹:新AI缺乏诗意,呼吁OpenAI开源o3 — repligate · 2026-08-20
- 去审查版 Qwen 拒答率降至 6%,但 27–56% 回答仍带保留 — creditme7 · 2026-08-20
- 用户本地部署 Qwen 27B 无审查版进行实验 — ChrisGPT · 2026-08-20
- Qwen 3.8 27B 实测:KV Cache f16 精度优于 q8_0 — Felixls · 2026-08-20
- Gemini 3.7 Flash 评测登顶,超多款旗舰模型 — mtizard · 2026-08-20