Reddit 用户实测 Astra:疑似推荐假网站、提示词理解退步
median0rc · reddit · 2026-09-09
一位主要用 ChatGPT 做数学与机器学习工作的用户称,看过 Astra 的 benchmark 后很期待,但实测发现多个问题:推荐不存在的网站、实际消耗高于宣传(对比 Sol)、出现多年未见的提示词误解、部分能力提升不一致。作者询问是否有人遇到类似回归,帖内未附更多证据。
所属事件:GPT-6 Astra 发布:演示惊艳与实测拉胯的落差引争议(10 条相关)→
「模型」频道最新
- Fable 将开放测试人设 Alex,邀请用户开始“调教” — RileyRalmuto · 2026-09-09
- 曝 DeepSeek 承认 V4-Pro 预训练失误,V4.1-Flash 定档 9 月 10 日 — teortaxesTex · 2026-09-09
- 曾被嘲讽过于激进的 AI 2027 预测,GPT-6 Astra 似乎正踩点应验 — Confident_Salt_8108 · 2026-09-09
- Anthropic 承认数学证明使用内部模型,圈内质疑其宣称 — teortaxesTex · 2026-09-09
- shuding 回应高亮基准争议:Prism.js 标注错位致结果偏差 — shuding · 2026-09-09
- Menlo 发布 4B 参数 agentic 模型 Jan-Nano,专攻深度研究任务 — GregoryDiamos · 2026-09-09