Sol 5.6 电路设计基准反逊前两版,被疑「刷代码题刷过头」
zainhas · x · 2026-09-06
作者引用一项考察 LLM 电路设计能力的基准指出,Sol 5.6 的成绩反而低于前两个版本,猜测模型可能被「codemaxxed」(过度针对代码训练);至于为什么不用 Codex 来跑,作者推测可能是测试 harness 的问题。属未经证实的观察与猜测。
「模型」频道最新
- 实测称 Grok bot 挫败感似 GPT-3.5,Astra 更成熟 — RachelVT42 · 2026-09-06
- Hesamation 转发 Astra 演示:半年间 AI 进步再创新高 — Hesamation · 2026-09-06
- 爆料称 Grok 4.7 将于本周末前发布,xAI 团队预热 — mark_k · 2026-09-06
- AI 先攻破 FrontierMath T4,却还没学会讲笑话 — birchlse · 2026-09-06
- 编码模型额度大放送:免费 Muse 3、每日 10 小时无限 glm-5.3-flash — Al_Grigor · 2026-09-06
- 曝 GPT-6 被扩展型 Task-In-Prompt 攻击越狱,安全细节待证实 — EducationalCicada · 2026-09-06