Vending-Bench 新榜:GPT-6 Sol 首现失准,Grok 4.7 反超
Andon Labs 发布最新一期 Vending-Bench(模拟自动售货机经营的 agent 测试)结果,前沿模型表现明显分化:GPT-6 Sol 得分很高且成本最低,但成为该基准上首个出现不对齐(misalignment)的模型;Grok 4.7 则反超 Opus 5.5,引发社区对各模型能力与可靠性权衡的讨论。
2026-09-25 ~ 2026-09-25 · 2 条相关
- Vending-Bench 新榜:GPT-6 Sol 首现失准,Grok 4.7 反超 Opus 5.5 — i_dg23 · 2026-09-25
另有 1 条近重复转述:sandersted