Qwen3.8-Omni-Flash 发布:全模态成本降 90%,39 种方言在列
量子位 · wechat · 2026-09-21
量子位实测阿里 Qwen 最新全模态模型 Qwen3.8-Omni-Flash。
- 成绩与价格:在 WildClawBench-MM 等 30 项评测平均分比上代 Qwen3.5-Omni-Plus 高 26%,音频能力超 Gemini 3.8 Flash;API 输入 0.8 元/百万 Token、输出 2.7 元,音频输入价格较上代降超 98%,音视频联合输入降超 93%,比优惠期 Gemini 3.8 Flash 便宜超八成。同步开放 1M 上下文免费额度。
- 实测一(MV 生成):让模型搭配 OmniChatCut 插件(调用 QwenImage、Wan 生成画面,FFmpeg 剪辑合成)为自己写的社畜摇滚生成 MV。分镜与人物立得住、部分画面逼真,但模型单打独斗不够,需装齐配套插件,流程约 1.5 小时。
- 实测二(长访谈提炼):梳理 Sam Altman×Marc Benioff 45 分钟访谈,能准确识别说话人、加时间戳,输出清爽无明显翻译腔,只是速度偏慢。
- 方言彩蛋:支持识别 39 种中文方言,粤语对话应答流利。
「多模态」频道最新
- SoundBoost 推出音乐视频生成器,一键产出完整 MV 素材包 — TheChuckTone · 2026-09-22
- eidoverse 世界搬进 Unreal:胸灯投射实时阴影效果惊艳 — repligate · 2026-09-22
- TTS 速度对比:SpaceXAI 每秒 106 字符达 87.6%,Kokoro 最快仅 55.5% — ArtificialAnlys · 2026-09-22
- TTS 发音基准价格账:Gemini 88.1% 卖 $18.31,Kokoro $0.65 最便宜 — ArtificialAnlys · 2026-09-22
- TTS 发音鲁棒性新基准:Gemini 3.1 Flash 以 88.1% 居首 — ArtificialAnlys · 2026-09-22
- 网友晒 qwen-image-2.1 实拍级生成 demo — cocktailpeanut · 2026-09-22