Jcode bench 推出首个不可污染的代码基准
ycombinator · x · 2026-08-25
Y Combinator 转发介绍了 Jcode bench,这是一个旨在解决现有代码基准污染问题的全新评测工具。当前基准存在私有难信、公有易刷题、评分粗糙且易饱和、难以区分前沿与中段模型、不贴近真实编码场景等缺陷。Jcode bench 的核心方案是给出一个参考实现,要求尽可能优化它,从而产生随时间推移的高信度连续分数。由于任务没有已知的最优解,训练数据中不存在答案,从而杜绝了模型通过死记硬背得分。若前沿模型的训练数据已被任务记录污染,则生成新规格任务并重跑。
「研究」频道最新
- 模型尚无独立科研能力,RSI 预测恐过于乐观 — BlancheMinerva · 2026-08-25
- GLiNER 2.5 发布:架构升级支持全文档长上下文提取 — huggingface · 2026-08-25
- 技术分析证实 stealth/ox-alpha 实为 Z.ai 的 GLM 模型 — PawelHuryn · 2026-08-25
- Nature Methods 发布 ProteinDPO 蛋白质生成模型 — BrianHie · 2026-08-25
- Thinking Machines 提出开放权重模型的安全路径 — luke_drago_ · 2026-08-25
- Headlong 实验持久化 Agent:指数退避与分层上下文 — lateinteraction · 2026-08-25