GPT-5.6 Sol 研究体验不错
karinanguyen · x · 2026-07-19
作者试用了新出的 **GPT-5.6 Sol**,总体评价很好。 他最明显的感受是:这个模型在研究场景里更“扛推敲”,很多时候不需要反复解释背景或意图,就能跟上任务推进。作者特别指出,这种提升在研究类工作里最明显。 配图则提到 **DiligenceBench**:它用 150 个偏真实的股权研究任务,覆盖 143 家美国上市公司,考察模型/智能体能否像分析师一样完成找文件、抽取数字、跨来源关联、区分事实与假设、形成投资判断等完整流程。也就是说,它测的不是简单问答,而是研究型 agent 的工作能力。
「模型」频道最新
- Reddit 说 Sol 更慢,但可靠性明显更强 — inY2K · 2026-07-21
- 对比实测显示 Kimi K3 在设计和推理上优于 Fable — OwariDa · 2026-07-21
- 内部模型解出 unit distance 问题,但不是 GPT-5.6 — soumitrashukla9 · 2026-07-21
- Anthropic 的反阿谀训练,可能让助手陷入身份冲突 — mfckr_eth · 2026-07-21
- Grok 4.5 High 成主力,Medium 可能更划算 — TheOyinbooke · 2026-07-21
- X 帖称 GPT-5.6 Pro 和 Sol-Ultra 正显露科学发现者潜力 — DeryaTR_ · 2026-07-21