开发者质疑 FrontierCode 基准测试结果异常
scaling01 · x · 2026-09-02
一位开发者对 FrontierCode 的基准测试结果表示困惑,认为该结果不太合理。尽管他认为 FrontierCode 是一个不错的基准测试,但这次出现的数据异常让他希望能了解背后的原因。
「研究」频道最新
- UT 石油工程系探讨 AI 教学与科研战略 — GeostatsGuy · 2026-09-02
- 人形机器人论文周报:坐立控制与 LAC 研究 — carlosdponx · 2026-09-02
- 新对齐思路:让 Agent 识别不可能任务并停止 — JacquesThibs · 2026-09-02
- 人类表现强势:Mazebench 前 10 名均分达 70% — patience_cave · 2026-09-02
- World Labs 发布 Atlas:时空模拟世界模型 — jasteinerman · 2026-09-02
- AI 设分子容易验证难,科学面临可观测性危机 — AnneliesGamble · 2026-09-02