实测者泼冷水:Astra 展示强但单步推理仍够不到研究级
xiaosun86 · x · 2026-09-07
作者对大账号们对 Astra 的集体 hype 表示反感,称平台上满是 posers。他认为 Astra 确实更好、尤其是呈现效果,但距离研究级思考还差一步:他分享了一个 ChatGPT 对话(Visualize Trap Effects)作为例证,并指出有意义的工作需要多步全部正确,单步正确率不足会迅速累积成失败。
所属事件:实测质疑 Astra 热潮:演示惊艳但多步推理仍差一步(4 条相关)→
「模型」频道最新
- Astra 自估距 AGI 很远,但配上工具使用后评分接近 — kevinnbass · 2026-09-07
- GLM 5.3、Qwen 3.8 可在单机本地流畅运行 — jasonkneen · 2026-09-07
- 新基准测模型自我建模:开源模型经RL提升但反事实仍易错 — dair_ai · 2026-09-07
- Alexandr Wang 点评 Muse Spark 1.3:时间跨度比肩 GPT-5.6 — alexandr_wang · 2026-09-07
- 31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍 — ionutvi · 2026-09-07
- GPT-6 Astra 生成导弹规避模拟视频,能力惊人 — algo_diver · 2026-09-07