Snorkel AI 五篇论文入选 NeurIPS:最难长程任务 Agent 通过率不足 1%
ajratner · x · 2026-10-02
Snorkel AI 研究团队宣布有五篇论文被 NeurIPS 2026 接收,聚焦 agent 能力评估与工程:
- Agents' Last Exam:长程专业任务评测,最难档位平均通过率不足 1%。
- Continual Learning Bench:检验 agent 能否从经验中持续改进。
- JudgmentBench:用资深律师的偏好判断对法律 AI 输出做排名。
- SkillOrchestra:按 agent 能力与成本路由任务。
- SlopCodeBench:发现 agent 写的代码每迭代一轮就更臃肿、更退化。
这批工作共同指向当前 agent 在长程任务、持续学习和代码质量上的短板,数据点(如 <1% 通过率、代码逐轮劣化)颇具参考价值。
「编程与Agent」频道最新
- SerenityOS 作者用五阶段悲伤论剖析 AI 时代的开源贡献模式 — vivekhaldar · 2026-10-02
- 澳洲独立开发者发布 OpenSwitchboard:让 AI 助手替人撮合线下交换 — EnvironmentalRice348 · 2026-10-02
- MCP 闹钟应用创意:让 Agent 跑完任务后自动叫醒你 — Angaisb_ · 2026-10-02
- Wellness Project 上线 Claude 连接器目录,聚合健康数据供 AI 分析 — turnnoblindeye · 2026-10-02
- FDE 实战方法论:三源映射法在企业里部署 AI — vasuman · 2026-10-02
- 开源 Rhyven Marketplace:给 Agent 装无头应用的统一 MCP 扩展平台 — Due-Telephone8276 · 2026-10-02