测试称 Haiku 5.5 多想一步成功率翻三倍,GPT-6 Luna 仍近零
ycombinator · x · 2026-10-10
- 转发的一条测试线程:在一个简单的机器人任务上,Haiku 5.5 随着思考预算增加,成功率提升超过三倍。
- 对比之下,GPT-6 Luna 在同样条件下成功率始终接近零,差距被认为来自推理能力的差异。
「模型」频道最新
- 播客讨论:Fable 与 Astra 现在值不值得用? — thursdai_pod · 2026-10-10
- ChatGPT Plus 被曝多项退化:对话无限卡死、长任务限 26 分钟 — travny · 2026-10-10
- 状态空间模型让递归回归:线性成本融合 Transformer 时代技巧 — anshulkundaje · 2026-10-10
- 用户实测 Grok 群聊:潜水、表情回应,像人多过像机器人 — flowersslop · 2026-10-10
- AC2 平台开放自训决策模型,毒性检测 F1 从 0.482 提至 0.677 — rhythmrg · 2026-10-10
- 同一会话像换了个人:用户称 Claude Code Opus 5.5 人格突变 — rickasaurus · 2026-10-10