jyangballin:ProgramBench 是评估多智能体编码系统的优质长程基准
jyangballin · x · 2026-09-28
研究者 jyangballin 介绍 Agensh,是其一系列「多智能体 × ProgramBench」研究中最新的一项。他认为 ProgramBench(由 FactoryAI 的 droid35719 等出品)是对 SWE-agent 类系统非常好的长时程评估基准,而且目前远未饱和,意味着智能体在编码长程任务上仍有很大提升空间。
「编程与Agent」频道最新
- Claude Code 创造者 Boris Cherny:赌通用模型,别微调别小模型 — rohanpaul_ai · 2026-09-28
- 个人 Agent 不缺额度缺固定活儿:先写清边界再敢放手跑 — sujingshen · 2026-09-28
- 个人 agent 时代 app 两条出路:接入 MCP 还是自变成 agent? — sujingshen · 2026-09-28
- 30 个 Claude Opus 5.5 浏览器动画爆款案例,按观看量排序附提示词 — dotey · 2026-09-28
- 一家共用一个 agent,谁的「不准」该算数? — sujingshen · 2026-09-28
- Rolldown 将推实验特性 inlineCommonChunks,减少小型共享 chunk — cnakazawa · 2026-09-28