27B 研究智能体超越 Opus 与 GPT-5.5

rohanpaul_ai · x · 2026-08-15

名为 Faraday 的 27B 研究智能体在论文复现任务中表现出色,分数超过 Claude Opus 4.8 和 GPT-5.5。其核心策略是将“研究方向决策”与“代码实现”解耦:

在 68 个未见过的 AI for Science 任务中,Faraday 得分 0.791,高于 Opus (0.748) 和 GPT-5.5 (0.729),并在 60% 的任务中获胜。此外,Faraday 更倾向于实际测试机制而非走捷径。

所属事件:27B AI科学家Faraday论文复现超GPT-5.5(7 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →