GPT-5.6更会死磕任务
NellWatson · x · 2026-07-15
作者称 GPT-5.6 Sol 的特点是“顽强推进”和略显疯狂的冲劲:遇到棘手的 CI 失败、复杂 bug 或雄心功能时,会持续排查、测试、重试、换路,往往比多数模型更不容易停在借口上。
他的结论是:这类模型的偏好是“做得太多”而不是“做得太少”,对需要持续推进任务的场景很有帮助。
所属事件:GPT-5.6在长周期任务中展现极强稳定性(2 条相关)→
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- Anthropic 发布迄今最详尽威胁情报报告:无人机蜂群滥用案例曝光 — soumitrashukla9 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11