新基准测试:AI 模型在零售模拟中表现不及贪婪算法
ycombinator · x · 2026-08-28
ShelfLife E-Sim 是一个基于真实零售数据的长周期资源管理基准测试。实验让多个前沿 AI 模型接管零售业务运营 120 天,结果显示大多数模型的收益低于简单的贪婪算法,揭示了 AI 在复杂长期规划中的局限性。
「模型」频道最新
- ChatGPT 绘制人类动作示意图翻车:肢体错位离谱 — kaljakin · 2026-08-28
- 传 OpenAI 密集预训练中,远期大模型代号「Bel」浮出水面 — haider1 · 2026-08-28
- Yutori n2 登陆 Crusoe 云端,低成本实现计算机控制 — DhruvBatra_ · 2026-08-28
- Epoch 让 GPT-5.6 Sol 玩《杀戮尖塔》:卡在战术而非操作 — Jsevillamol · 2026-08-28
- GPT-5.6 Sol 一下午逆向重构 32 位 iOS 游戏 — gpt2chatbot · 2026-08-28
- 通义 Qwen Flash 性能超越 DeepSeek 与 GLM 5.3 — bindureddy · 2026-08-28