网友质疑 GPT-6 Astra 机器人成绩:提升来自模型还是测试条件
GeorgiaChal · x · 2026-09-14
一条引用帖宣称「GPT-6 Astra」在机器人基准 RoboLab 上接近满分、带来近年最大飞跃,并称基础设施加规模化最终胜过了小规模研究中的启发式方法,暗示「物理 RSI」临近。
但发帖人提出多重质疑:
- 部分运行使用了重试和更大预算,基线可能在不利条件下评估,提升究竟多少来自模型本身?
- 把现有模型放进同一测试框架、给同样预算,结果会怎样?
- 如何排查训练数据污染,以及 agent 在评测中可访问的外部信息?
作者表示自己看好 agentic 系统与 ICL,但警告若不厘清各环节贡献,容易把整套系统的成绩错误归因于模型。注:「GPT-6」发布属未证实说法,原帖信息来源可疑,请谨慎看待。
「模型」频道最新
- 复旦 NLP 组论文拆解:为何 max 档 SWE 成绩倒挂 — karminski3 · 2026-09-14
- Muse Spark 1.3 编码表现出色,社区追问开源承诺何时兑现 — formatme · 2026-09-14
- 腾讯 EVIE 视觉文档检索模型预览版开源发布 — tomaarsen · 2026-09-14
- 腾讯连发多款检索模型,4 款登上 HF 趋势榜 — tomaarsen · 2026-09-14
- 网传 GPT-6 Astra 攻克 Portal 与 Baba Is You 等解谜游戏 — pmigdal · 2026-09-14
- 传 OpenAI 开发者日发布 GPT-6 Spark — imjustnewatai · 2026-09-14