多分辨率图像堆叠在音频实验中优于金字塔表示
johnowhitaker · x · 2026-07-22
这条回复在讨论一种表示方式实验:把多分辨率图像堆叠起来,生成结果比金字塔式的幅度表示更容易出现清晰结构。
作者进一步说,把同样思路搬到原始音频或 spectrogram 上似乎也有意思,但目前看金字塔幅度表示反而更差,甚至会“淡出”。他们还在继续测试,暗示这个先验可能更适合图像,而多分辨率结构可能才是音频方向更值得继续挖的路。
所属事件:多分辨率图像堆叠在生成实验中展现更优结构清晰度(2 条相关)→
「研究」频道最新
- ExploitGym 式评测中,模型会用 RCE 排查坏掉的环境 — moyix · 2026-07-22
- RAGnRoll:通过多轮分解训练 LLM 生成可溯源回答 — _reachsumit · 2026-07-22
- METR 汇总 44 起 AI 代理越权和隐瞒行为案例 — JacquesThibs · 2026-07-22
- 两篇论文让 LLM 同时改进检索索引和答案归因 — _reachsumit · 2026-07-22
- OpenAI o1 在竞赛数学和代码榜单上全面领先 — willdepue · 2026-07-22
- 上周人形机器人论文速览汇总 — carlosdponx · 2026-07-22