测试 8 个顶级模型:长周期经营任务 AI 仅达人类 27.3% 水平
rohanpaul_ai · x · 2026-10-02
作者引用一项长周期智能体压力测试:让智能体面对一整年的相互关联决策、延迟反馈和自身历史行为的后果,顶级模型表现相对人类大幅崩塌。测试覆盖 8 个前沿模型,最佳组合 Qwen3.7-Max + Hermes 在模拟经营结束时手里的钱也只有人类参与者的平均 27.3%。结论:模型离可靠的长期任务执行能力还差得远。
「模型」频道最新
- ThursdAI 周报:GPT-6.1 Sol、Sonnet 5.5、Gemini 4 Argon 同周齐发 — altryne · 2026-10-02
- Claude Max 用户:Opus/Sonnet 用量近乎无限 — petergyang · 2026-10-02
- Gemini 配额今晨 10 点重置,网友提醒抓紧用 Ultra 额度 — Bloated_Plaid · 2026-10-02
- Gemini 4 Pro Argon 疑似仅极少数人可用,谷歌基准亮眼放开却极少 — gaganghotra_ · 2026-10-02
- Yacine吐槽:Opus 5.5安全护栏对无关内容疯狂触发 — yacineMTB · 2026-10-02
- GPT-6.1-sol实测:基础智能重回水准是最大亮点 — haider1 · 2026-10-02