用户实测:GPT-5.6 Sol Astra 上线后商务推理可靠性骤降四五成
biarschal95 · reddit · 2026-09-08
一位正在搭建 AI 重度招聘 SaaS 的 Reddit 用户报告,GPT-5.6 Sol High/Very High 在 Astra 上线后出现明显退化:
- 他用四层系统:平台跑在 Anthropic 上,战略/商务工作用 ChatGPT,此前把 Sol 当"第二 CEO 大脑"处理营销、GTM、产品决策,体验很好
- 明确强调退化的不是编码、数学、benchmark 或 agent 任务,而是长篇商务推理和复杂战略上下文保持,自称可靠性掉了约 40–50%
- 典型症状:10 秒前刚生成的总结文档随即被判"没意义";承认了纠正几条消息后又回退到刚被推翻的立场;简单状态修正从 1 分钟变成 5–10 分钟推理循环;记住了所有事实但错误连接后自信地继续盖楼
- 他问社区:这是真 nerf 还是 Astra 部署期间的临时不稳定,之前类似发布后一般多久恢复
「模型」频道最新
- Grok 4.6 登顶 AutomationBench-AA 第二,超越多款旗舰模型 — XFreeze · 2026-09-08
- 用户称 OpenAI API 全天无响应,请求挂 30 分钟后被丢弃 — msch6873 · 2026-09-08
- DeepSeek V4.1 Flash 问卷引热议:被问能否全面替代 V4 Pro — zephyr_z9 · 2026-09-08
- 安全研究员叹出题难:自设 CTF 挑战被 GPT 意外秒解 — terryyuezhuo · 2026-09-08
- DeepSeek 官宣 V4-Flash-Vision,网友实测称能力不及现款 Flash-Vision — teortaxesTex · 2026-09-08
- 曝 OpenAI 内部模型 Bel 产出约百页证明,挑战 Navier-Stokes 千禧难题 — imjustnewatai · 2026-09-08