Qwen3.8-27B 实测 AIME 2026 拿 29/30,FP8 追平 BF16 且快近 3 倍
No_Run8812 · reddit · 2026-08-21
作者在 MathArena/aime2026 数据集上对比了 Qwen3.8-27B 的 BF16 与 FP8 权重(medium 与 xhigh 推理力度),结果:
- FP8 xhigh 拿下 29/30(96.7%),与 BF16 xhigh 持平,但解码速度从 28 tk/s 提到 76 tk/s,预填速度也快得多;
- FP8 medium 为 26/30,BF16 medium 为 28/30,量化在 medium 档略有损耗;
- 第 7 题两种 xhigh 设置都耗尽上下文 token 预算未给出最终答案,属空跑而非答错。
对比前沿模型(单次 pass@1):GPT-5.6 Sol xhigh 报告分 99.9%、GLM-5.2 99.2%、GPT-5.4 99.2%、Gemini 3.1 Pro 98.3%、Claude Opus 4.6 与 DeepSeek V4 Pro 均 96.7%——一个 27B 模型 FP8 量化后追平了多款旗舰,性价比惊人。
评测条件:exact-match 评分、温度 0、关闭采样、相同 chat template 与 prompt 格式。
「模型」频道最新
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24
- Sakana AI 翻译模型日英评测超越 Google 与 DeepL — SakanaAILabs · 2026-08-24
- 不服 theo 的模型梯队榜,开发者 haider 自制一份自己的版本 — haider1 · 2026-08-24
- 神秘OxAlpha碾压Claude,阿里800亿港元押注AI — 创业邦 · 2026-08-24
- OpenAI谷歌掀大模型降价潮,智谱神秘模型碾压Claude — 创业邦 · 2026-08-24
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24