Artificial Analysis 四天两次调榜,Astra 真实实力获认可
py-net · reddit · 2026-09-09
Reddit 帖称 Artificial Analysis 在 4 天内两次更新榜单以反映 Astra 的真实能力。类似情况此前也发生过:Sol 发布后 Arena 重构了编码基准、新增全栈基准并更新 webdev 基准以贴近真实表现。作者据此认为 OpenAI 是唯一没有刷榜(benchmaxxing)的实验室。
「模型」频道最新
- Qwen 开源驾驶模型 Drive-1.0-4B,基于 Qwen3.5 微调 — FullstackSensei · 2026-09-09
- Inception 发布 Mercury 2.5:扩散 LLM 智能涨 40%,跑出 1100 tokens/秒 — timshi_ai · 2026-09-09
- OpenAI 宣布用 Agent 求解 90 年未解的 Navier-Stokes 难题 — thesaraharminta · 2026-09-09
- OpenAI 新模型 88 小时解 Navier–Stokes,万级 Agent 协同攻坚 — legit_api · 2026-09-09
- 质疑 OpenAI 万 Agent 隔离:连千实例都没管住过 — scaling01 · 2026-09-09
- Gary Marcus 晒 GPT-6 Astra 生成视频,嘲讽 OpenAI「人类级智能」说法 — GaryMarcus · 2026-09-09