实测 Qwen 2.5 72B 参加 ACT 考试:阅读满分,综合 36 分
on_line187 · reddit · 2026-08-20
作者在双 RTX 3090 上运行 Qwen 2.5 72B (Q8 GGUF) 模型,让其通过视觉能力直接阅读官方 ACT 练习题 PDF 并作答。在两套共 342 道题的测试中,模型答对 326 题(95.3%),阅读部分获得满分,综合得分达到 36 和 34 分(满分 36),表现达到顶尖人类水平。模型作答时间约为每套 88 分钟。
「模型」频道最新
- 开源模型体验尚存摩擦,闭源与开源将共存增长 — JosephJacks_ · 2026-08-21
- OpenAI「数学突破」遭质疑:真功夫在提示工程而非模型 — gerardsans · 2026-08-21
- 用户实测:ChatGPT 浏览版生成速度与质量优于 Codex — jasondeanlee · 2026-08-21
- 猜测 Google 将在 Gemma 活动上发布新模型 — Porespellar · 2026-08-21
- DeepSeek Flash 需量激增百倍,因推理极廉 — bindureddy · 2026-08-21
- 实测 DeepSeek V4 审美较差,恐因隐藏思维链 — teortaxesTex · 2026-08-21