ASI-Bench 揭示指令方式显著影响 AI 自主科研表现
新论文《ASI-Bench: At the Dawn of Artificial Superintelligence》发布了测试 AI 自主科研与探索能力的基准,由 40 多位专家耗时 3.1 万小时构建,涵盖 11 个科学领域的 60 个真实研究项目。测试发现指令方式对 Agent 性能影响巨大:对比“完整步骤”“仅方法名”和“无方法”三种指令,仅告知方法名称反而导致性能暴跌,说明提示设计在自主科研场景中至关重要。
2026-08-25 ~ 2026-08-25 · 2 条相关
- ASI-Bench 研究:仅命名方法导致 Agent 性能暴跌 — rohanpaul_ai · 2026-08-25
- ASI-Bench 基准:测试 AI 自主科研与探索能力 — rohanpaul_ai · 2026-08-25