传 GPT-6 Sol 在 HealthBench 等安全评测上不及上代 Sol
sytelus · x · 2026-09-23
sytelus 称 GPT-6 Sol 在 HealthBench、DeepSwe、网络安全及部分生物/化学安全评测上表现不及上一代 Sol,暗示新模型在安全相关维度可能有所回退。此说法未附来源,属未经证实的观察。
所属事件:GPT-6 Sol/Luna 评测:价格减半幻觉下降,部分基准不敌前代(15 条相关)→
「模型」频道最新
- Andriy Burkov 感叹 Codex 速度远超开源权重模型 agent,但费用高昂 — burkov · 2026-09-23
- 网传 GPT-6 可在浏览器操控 Paint 作画,演示引热议 — alexcovo_eth · 2026-09-23
- 开发者用 Opus 5.5 生成 three.js 法术与程序化音视效 demo — majidmanzarpour · 2026-09-23
- 网友实测疑似 Opus 5.5:接 Scenario Blender 插件效果「离谱」 — repligate · 2026-09-23
- 观点:GPT-6 Sol 定价腰斩,对标对象应是 Sonnet 而非 Opus — TraditionalHome8852 · 2026-09-23
- 用户两个 OpenAI 20x 账号用量已耗至剩 13%,试水 GPT-6 效率 — jdjohnson · 2026-09-23