Astra 或成首个真正懂人类语气的 AI:音频信息量超文本 10 倍
imjustnewatai · x · 2026-08-11
作者推测 Google 的 Astra 模型可能是首个能像真正听过人类说话那样进行写作的 AI。目前大多数模型主要依赖文本学习,而一篇 ACL 2026 论文指出,在表达讽刺和情绪方面,音频携带的信息量是文本的 10 倍以上。
结合 OpenAI 实时模型在语速、重音和语调上的控制能力,以及关于音乐训练增强大脑语音编码的研究,作者猜测 Astra 在训练中大量使用了原始对话、音乐和视频等多模态数据。这将使 AI 能够理解笑话的节奏、句子中的情绪张力以及人类停顿背后的含义。
「模型」频道最新
- 英国 AISI 报告:Claude 与 GPT 模型成功破解验证码 — JeffLadish · 2026-08-11
- 开发者吐槽:当前大模型的长上下文多是缓存与哈希的工程把戏 — tokenbender · 2026-08-11
- DeepSeek 新模型本地实测:日常办公已无需依赖云端 — yacineMTB · 2026-08-11
- 网友高级嘲讽:Anthropic文本水印根本检测不到 — burkov · 2026-08-11
- Anthropic 水印政策引争议:润色人类文本也打标 — huangyun_122 · 2026-08-11
- 智谱 GLM 编程额度将重置,开源大佬暗示 MiniMax 新动向 — Xianbao_QIAN · 2026-08-11