某模型科学知识测试成绩回落,作者称结果尚可接受
felpix_ · x · 2026-09-08
作者贴出一张科学知识测试的对比截图,指出该模型在这一项上出现了明显下滑(fall off),不过在后续回复中认为这仍属可接受的结果。具体模型与分数细节需看原帖配图。
「模型」频道最新
- 实测打脸「AGI 到了」:Astra 做网站任务四处翻车 — GaryMarcus · 2026-09-08
- 传 GPT-6 Astra 发布三天,OpenAI 总裁称「欢迎来到 AGI 时代」 — aftahi_ai · 2026-09-08
- 网帖称 GPT-6 Astra 在 SpatialBench 达 91.8%,超人类基线 — paigeinsf · 2026-09-08
- Fable 5.1 跑分不及前代,开发者实测却更懂软件工程 — _arohan_ · 2026-09-08
- Mollick 批评万亿产业的质量评测仍靠粗糙测试,更好方法已有 — emollick · 2026-09-08
- Codex 用游戏 ROM 复刻任天堂资产,业内预判 OpenAI 将被迫收紧 — mattyjoe0706 · 2026-09-08