ASI-Bench 研究:仅命名方法导致 Agent 性能暴跌
rohanpaul_ai · x · 2026-08-25
基于 ASI-Bench(涵盖 11 个科学领域的 60 个真实研究项目)的测试表明,告诉 Agent“使用什么方法”效果极差。对比“完整步骤”、“仅方法名”和“无方法”三种指令,仅提供方法名的平均得分从 50.91 降至 29.10,且成本高出 59%。研究结论是:决定性能的是过程步骤而非方法名称,命名方法反而会限制 Agent 且使其需重建实现细节。
所属事件:ASI-Bench 揭示指令方式显著影响 AI 自主科研表现(2 条相关)→
「编程与Agent」频道最新
- 实测:谷歌 Gemini Flash 修复漏洞数少且贵,不敌 OpenAI 平价模型 — PawelHuryn · 2026-08-25
- 开发者演示强化学习编码模型,用 JavaScript 库 p5.brush 绘画 — round · 2026-08-25
- Weaviate 推出可配置 effort 参数,测试时计算提升检索精度 — CShorten30 · 2026-08-25
- Stock MCP Server:利用腾讯 API 提供实时行情 — modelcontextprotocol · 2026-08-25
- Releases:面向 Agent 的产品更新日志 API — modelcontextprotocol · 2026-08-25
- Okta 正式发布 Agent SSO,统一管理 AI 智能体身份 — yenkel · 2026-08-25