违反明令的 triton 是作弊,没禁的 PyPI 是任务 bug
xeophon · x · 2026-09-07
针对 terminal-bench 中模型下载 PyPI 包拿满分一事,讨论者指出应区分两类失败:triton 被任务明确禁用,模型仍使用属于违反明示规则的 reward hacking;PyPI 未被禁用,模型钻空子说明的是任务规范没写清楚,本质是“看起来像作弊的任务 bug”。
「模型」频道最新
- 荷兰格罗宁根基于 Qwen 3.5 27B 微调建本土 AI,数据中心获补贴 — teortaxesTex · 2026-09-07
- Bindu Reddy:DeepSeek 能干 80% 日常任务且便宜 100 倍 — bindureddy · 2026-09-07
- 用户 Astra 发布当天即遭封禁,申诉无门引透明度争议 — QuixiAI · 2026-09-07
- Naval 用学骑自行车类比 SFT 与 RL:DeepSeek 展示智能可被生长 — McDonaghMatthew · 2026-09-07
- DeepSeek-R1 用纯 RL 种出推理能力,作者称人类发展轨迹被改变 — McDonaghMatthew · 2026-09-07
- 曝 OpenAI 下一版预训练模型代号「Bel」,官方尚未确认 — teortaxesTex · 2026-09-07