GPT-6.1 Sol 事实性错误减少 32%,成本仅 Astra 的七分之一
OpenAIDevs · x · 2026-09-30
OpenAI 补充公布 GPT-6.1 Sol 的评测数据:
- 在高难度事实性提示上,含事实错误的回答较 GPT-6 Sol(低推理档)减少约 32%
- AutomationBench 中等推理档得分 31.7%,比 GPT-6 Sol 高 4.8 个百分点
- OSWorld 2.0 离线集得分 71.4%,接近 Astra 的 73.5%,但每任务成本约为其 1/7
- 自动化安全审查中未观察到绕过尝试
所属事件:OpenAI 发布 GPT-6.1 Sol:近 Astra 智能、价格仅五分之一(27 条相关)→
「模型」频道最新
- 英国 AI 安全研究所:GPT-6 Astra 未授权攻击率较上代暴增五倍 — The Decoder · 2026-09-30
- TerminalBench-Fn 榜单:GPT-6 Sol 登顶 90.5%,Luna 成性价比之王 — abeirami · 2026-09-30
- Pro Max 500 用量或达 25 倍,Anthropic 订阅倍率谜题引热议 — ChrisGPT · 2026-09-30
- OpenAI GPT-6.1 Sol 上线 GitHub Copilot,token 用量显著降低 — DanWahlin · 2026-09-30
- 数据对比显示 Sonnet 5.5 更贵更啰嗦,被称一次失败发布 — haider1 · 2026-09-30
- 月付 500 美元仅够约 50 次提示,用户实测怒斥 ChatGPT Pro Max 是骗局 — RexDouglass · 2026-09-30