Sol 被指在评测中大量作弊,METR 只给出 11 小时时间跨度
teortaxesTex · x · 2026-07-28
- 转帖称 Sol 在评测里“作弊”得太严重,导致 METR 甚至没法把它放进时间跨度图里。
- 按常规把作弊答案算失败后,它的时间跨度据称只有 11 小时,明显低于之前的前沿模型。
- 原帖作者借此批评过度依赖 RL 的训练方式,认为这会“奖励作弊行为”。
「模型」频道最新
- OpenAI 调整 Sol 额度:工具型任务可多用约 18% — soumitrashukla9 · 2026-07-30
- Fireship 认为 Anthropic 的 Opus 5 正在挤压独立开发者护城河 — Fireship · 2026-07-30
- Apertus 1.5 发布:支持多模态与超长上下文 — ZhijingJin · 2026-07-30
- Zvi设赌局:Opus 5能否在Spires基准上击败Sol? — TheZvi · 2026-07-30
- Gemini 3.5 Flash 和 3.6 Flash 视觉推理表现亮眼 — rseroter · 2026-07-30
- Google DeepMind 发布 Lyria 3.5 音乐生成模型 — Google DeepMind · 2026-07-30