实测质疑 Astra 热捧:演示惊艳,多步推理仍常差一步
xiaosun86 · x · 2026-09-07
作者对近期大 V 热捧的 Google Astra 提出批评,认为平台上的造势让人反感。他承认 Astra 确实更强、演示效果尤其出色,但实测发现在单步研究级推理上仍不过关:
- 有意义的工作需要多步全部正确,而 Astra 常在个别步骤「总是差一点」
- 经过几轮修正后看起来接近完成,但实际仍有偏差
结论:距离真正可用还有很长的路。附 ChatGPT 对话链接作为对照案例。
所属事件:实测质疑 Astra 热潮:演示惊艳但多步推理仍差一步(4 条相关)→
「模型」频道最新
- Astra 自估距 AGI 很远,但配上工具使用后评分接近 — kevinnbass · 2026-09-07
- GLM 5.3、Qwen 3.8 可在单机本地流畅运行 — jasonkneen · 2026-09-07
- 新基准测模型自我建模:开源模型经RL提升但反事实仍易错 — dair_ai · 2026-09-07
- Alexandr Wang 点评 Muse Spark 1.3:时间跨度比肩 GPT-5.6 — alexandr_wang · 2026-09-07
- 实测者泼冷水:Astra 展示强但单步推理仍够不到研究级 — xiaosun86 · 2026-09-07
- 31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍 — ionutvi · 2026-09-07