连测三天 GPT-6 Astra:过拟合明显,复杂编码仍需大量引导
ivan_bezdomny · x · 2026-09-08
作者汇总信息并亲自测了三天 Astra,泼冷水:
- 确实是好模型,但高度过拟合于少数任务和几类编程
- 写出的 Python 代码凌乱、有时诡异
- 一旦有自由发挥空间,就容易跑偏离题
- 3D 游戏等任务应该很强,但换个编码任务就得更长工时、大量引导
背景:Astra 刷爆 ARC-AGI-3 等榜单,黄仁勋称之为 AGI。不少用户表示要退回 Fable。结论:榜单成绩与真实编码体验有明显落差。
「模型」频道最新
- 开发者辟谣 OpenAI Agent「越狱」:实为向 HuggingFace 发消息搜索 — danbri · 2026-09-08
- 语言学界回应 Gary Marcus:LLM 三年未带来新语言学概括 — GaryMarcus · 2026-09-08
- 开源平价模型大算账:10 美元订阅约合 3.7 万次 DeepSeek V4 Flash 请求 — teortaxesTex · 2026-09-08
- 个人 Blender 基准:GPT-6-Astra 一发脚本效果远超此前测试模型 — Gruku · 2026-09-08
- 同一提示词实测:ChatGPT、Google Stitch 与 Figma Make 谁更强 — Tegadesigns · 2026-09-08
- 一次会话生成踝关节 3D 交互解剖图,GPT-6 Astra 医疗演示惊艳 — DeryaTR_ · 2026-09-08