Astra 表现平平遭全网找补,楼主吐槽:评测标准双标现场
Tim_Apple_938 · reddit · 2026-09-06
楼主吐槽社区对 Astra 的集体「找补」:以前每出一代模型,大家比拼 benchmark 分数和 artificialanalysis 的对比图表;这次 Astra 没有显示出提升,风向立刻变成「所有 benchmark 都是造假/都是谎言」,真正的检验变成了「能不能在 Blender 里画出一套公寓」。
帖子附了两个参考链接:一个是引发讨论的 Blender 绘图演示推文,一个是所谓「Villa bench」对比。整帖是对社区双标行为的讽刺,也是 Astra 发布后口碑争议的一个缩影。
「模型」频道最新
- 开发者实测:OpenAI Astra 是唯一能推进极复杂项目的模型 — mrjonfinger · 2026-09-06
- GPT-6 Astra 10 分钟把 38 页小屋图纸变成 3D 漫游 — LukeW · 2026-09-06
- GPT-6 Astra 登陆 OpenResearch,登顶 Terminal-Bench-Science — burny_tech · 2026-09-06
- GPT-6 Astra 发布一天即遭越狱,TIP 攻击组合技私报 OpenAI — Asleep-Requirement13 · 2026-09-06
- 全火箭 emoji 提示词测试:GPT-6 Astra 仅 Max 档给出回应 — iamaliveix · 2026-09-06
- Grok Bot 重置全部用量限制,优化后额度平均多出 10% — Baconbrix · 2026-09-06