SlopCodeBench 全量跑分出炉:Astra 领先但优势有限
cedric_chee · x · 2026-09-13
dexhorthy 完成了 SlopCodeBench 的首次全量运行(此前只跑小子集),对比 GPT-6 Astra、GPT-5.6 Sol 与 GLM 5.3(Fable 5.1 结果待出)。
要点:
- Astra 得分略高于 GPT-5.5,但领先幅度比预期小;Sol 得分偏低。
- 此前有报告称 Astra 生成代码会随对话轮次逐渐膨胀劣化,并出现 golf 式压缩代码行为。
- 作者自述局限:跑了约一周、因供应商故障多次中断;更严谨做法应多次运行取聚合分数。
「编程与Agent」频道最新
- yacine 晒纯手机对话 AI 完成的第三版 CAD 设计 — yacineMTB · 2026-09-13
- CoreWeave Hacks 开幕:200+ 开发者 24 小时造「能自我纠错」的 Agent — wandb · 2026-09-13
- 开发者用 Rork 重构 2019 年旧应用:AI 时代上架效率大增 — rudrank · 2026-09-13
- 让 agent 把截图拼成联络表省 token,大幅减少图片读取开销 — pvncher · 2026-09-13
- Ruff 作者:我们高估了人类代码质量,尤其是自己的 — charliermarsh · 2026-09-13
- 编码工具Amp宣布BYOK完全免费,取消限额与费用 — HamelHusain · 2026-09-13