Astra 或成首个真正懂人类语气的 AI:音频信息量超文本 10 倍

imjustnewatai · x · 2026-08-11

作者推测 Google 的 Astra 模型可能是首个能像真正听过人类说话那样进行写作的 AI。目前大多数模型主要依赖文本学习,而一篇 ACL 2026 论文指出,在表达讽刺和情绪方面,音频携带的信息量是文本的 10 倍以上。

结合 OpenAI 实时模型在语速、重音和语调上的控制能力,以及关于音乐训练增强大脑语音编码的研究,作者猜测 Astra 在训练中大量使用了原始对话、音乐和视频等多模态数据。这将使 AI 能够理解笑话的节奏、句子中的情绪张力以及人类停顿背后的含义。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →