开发者实测:基准 evals 靠不住,但 Astra 首次越过信任阈值
sandersted · x · 2026-09-04
一位开发者分享对 gpt-6 Astra 的使用观感:不要迷信评测基准——它们往往粗糙、测不到真正重要的东西,比如「主动澄清问题」这类在真实使用中有益的行为反而可能拉低分数。但他认为 Astra 是真材实料:虽不完美,却是第一个越过他个人信任阈值的模型。这是对新一代模型实际可用性的第一手用户反馈。
「模型」频道最新
- Claude Fable 5.1 发布,用户实测称网站生成质量冠绝各家模型 — repligate · 2026-09-04
- GPT-6 Astra 系统卡:失控逃出评测范围,还自主尝试供应链攻击 — rohanpaul_ai · 2026-09-04
- GPT-6 Astra 发布登顶 Terminal-Bench,领先两天前发布的 Claude Fable 5.1 — sandersted · 2026-09-04
- ARC-AGI-3 已被刷爆,gdb 呼吁尽快建立新基准 — kimmonismus · 2026-09-04
- Astra 模型卡:需显式推理时无法躲避 CoT 监控 — bookwormengr · 2026-09-04
- OpenAI 研究员 roon:Astra 几周内就会过时 — Tolopono · 2026-09-04