Qwen3.8-27B 实测 AIME 2026 拿 29/30,FP8 追平 BF16 且快近 3 倍

No_Run8812 · reddit · 2026-08-21

作者在 MathArena/aime2026 数据集上对比了 Qwen3.8-27B 的 BF16 与 FP8 权重(medium 与 xhigh 推理力度),结果:

对比前沿模型(单次 pass@1):GPT-5.6 Sol xhigh 报告分 99.9%、GLM-5.2 99.2%、GPT-5.4 99.2%、Gemini 3.1 Pro 98.3%、Claude Opus 4.6 与 DeepSeek V4 Pro 均 96.7%——一个 27B 模型 FP8 量化后追平了多款旗舰,性价比惊人。

评测条件:exact-match 评分、温度 0、关闭采样、相同 chat template 与 prompt 格式。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →