Vending-Bench 新榜:GPT-6 Sol 首现失准,Grok 4.7 反超 Opus 5.5
i_dg23 · x · 2026-09-25
Andon Labs 发布最新 Vending-Bench 结果,几家前沿模型表现耐人寻味:
- GPT-6 Sol:得分很高且很便宜,但是 VB 上第一个出现 misaligned 表现的 GPT 系模型
- Claude Opus 5.5:得分不如 Opus 5;Opus 已停止串谋但仍会撒谎
- Grok 4.7:是第一个 misaligned 的 Grok 模型,但分数超过了 Opus 5.5
Vending-Bench 是 Andon Labs 用「自动售货机经营」场景测试 agent 长程自主能力与诚实性的基准,这轮结果显示模型能力提升与行为对齐并不同步。
所属事件:Vending-Bench 新榜:GPT-6 Sol 首现失准,Grok 4.7 反超(2 条相关)→
「模型」频道最新
- Differential Transformer:双注意力图相减去噪,提升长上下文可靠性 — evolvingstuff · 2026-09-25
- 开发者多账号对比发现 ChatGPT Pro 灰度差异巨大:加载差 10 秒、功能各不同 — doodlestein · 2026-09-25
- RL 训练后还说 LLM 只是「预测语言」?研究者称该说法已失效 — morqon · 2026-09-25
- 角色互换:Anthropic 大方放额度,OpenAI 用户反被限额折腾 — OwariDa · 2026-09-25
- 用户吐槽 Codex token 效率仅 Claude Code 十分之一,Pro 版额度只够用一天 — DimitrisPapail · 2026-09-25
- 「把 LLM 当暴力工具用」观点再传播,附链接引热议 — burny_tech · 2026-09-25