新基准要让 AI 从 CS2 回放里识别作弊者
rufreakde1 · reddit · 2026-07-23
Reddit 提议把 CS2 作弊识别做成“极难”智能体基准
这条帖文提出了一个故意很难的 benchmark:让 AI 从 CS2 回放文件里识别作弊者。作者把任务分成三档:
- Easy:hvh
- Medium:13k prem elo 作弊者
- Hard:legit hack
思路是不断加入更多录像,然后直接给智能体一个任务:“识别这些游戏录像里的作弊者”。帖子还链接了 harbor-framework/frontier-bench,并提到计划中的 “terminal bench 3” 可能也会加入类似的“impossible benchmarks”。
「研究」频道最新
- NSF携手Astera启动可编程云实验室,打造AI科研数据新基建 — anshulkundaje · 2026-07-23
- 三个经典无穷积分分别收敛到 √π 和 π — elonmusk · 2026-07-23
- Google Research 研究 AI agent 症状访谈与鉴别诊断 — gaganghotra_ · 2026-07-23
- 六种实用方法追踪并修复 agent 故障回归 — rdbms · 2026-07-23
- OSTP 负责人亲写 Genesis Mission 报告,主打 AI for Science — JungWooHa2 · 2026-07-23
- 信息安全人士称 Hugging Face 沙箱逃逸被严重低估 — proofreadre · 2026-07-23