GigaChat Audio 要做 120 分钟长音频时间定位
ai-sage · hf · 2026-07-21
- GigaChat Audio 是一个面向长音频的时间感知大语言模型,重点解决音频里的时间定位问题。
- 它可以在最长 120 分钟 的输入上,给出带明确时间戳的回答。
- 方法上,模型把周期性时间标记和连续音频 token 交错起来,并通过大规模合成监督的级联流程训练。
- 作者称它在短/长基准上都取得了较强的时间定位准确率,还支持按时间锚定的片段描述与摘要。
- 项目同时开放了模型权重和数据集,便于后续研究复现与扩展。
「研究」频道最新
- ARISE 研究评测 45 个医疗 AI 工具,覆盖 1100 个会诊案例 — HealthcareAIGuy · 2026-07-21
- 异步 OPD 蒸馏在数学任务上提速约两倍 — _lewtun · 2026-07-21
- 一个预测建模教训:只看 R2 为什么会更糟 — mdancho84 · 2026-07-21
- Google DeepMind 分享 Project Genie 的创作者协作幕后 — alexanderchen · 2026-07-21
- Nat Lambert 反驳 RL 蒸馏直接用最强模型当老师 — natolambert · 2026-07-21
- 线程称 GPT-5.6 Sol 帮忙构造出 Jacobian 猜想反例工厂 — LucaAmb · 2026-07-21