测试 8 个顶级模型:长周期经营任务 AI 仅达人类 27.3% 水平

rohanpaul_ai · x · 2026-10-02

作者引用一项长周期智能体压力测试:让智能体面对一整年的相互关联决策、延迟反馈和自身历史行为的后果,顶级模型表现相对人类大幅崩塌。测试覆盖 8 个前沿模型,最佳组合 Qwen3.7-Max + Hermes 在模拟经营结束时手里的钱也只有人类参与者的平均 27.3%。结论:模型离可靠的长期任务执行能力还差得远。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →