27B 研究智能体超越 Opus 与 GPT-5.5
rohanpaul_ai · x · 2026-08-15
名为 Faraday 的 27B 研究智能体在论文复现任务中表现出色,分数超过 Claude Opus 4.8 和 GPT-5.5。其核心策略是将“研究方向决策”与“代码实现”解耦:
- 任务设定:移除论文中某个结果图表,要求智能体复现该结果。这迫使智能体处理论文中省略的实现细节、简化策略及实验验证。
- 训练方法:基于 242 个此类任务进行训练,使用自动评分标准进行评估。
- 工作流:模型负责像研究员一样思考并规划研究任务,底层调用更强的编码模型(如 GPT-5.5)执行代码。
在 68 个未见过的 AI for Science 任务中,Faraday 得分 0.791,高于 Opus (0.748) 和 GPT-5.5 (0.729),并在 60% 的任务中获胜。此外,Faraday 更倾向于实际测试机制而非走捷径。
所属事件:27B AI科学家Faraday论文复现超GPT-5.5(7 条相关)→
「编程与Agent」频道最新
- 实测 Qwen 3.8 27B 模型生成精美网站代码 — talkaboutdesign · 2026-08-15
- Qwen 3.8-27B 实测:安全分析能力超越前 SOTA 本地模型 — Potential_Block4598 · 2026-08-15
- xAI 推出 Grok Bot:可自主操作工具的 AI 同事 — HamelHusain · 2026-08-15
- 网友把 DeepSeek 后训练同款 harness 装进 Mac 容器,本地智能体能力大涨 — IngeniousIdiocy · 2026-08-15
- Datadog 引入 telemetry intent 字段优化 MCP 可观测性 — cjimti · 2026-08-15
- 开发者自建工具链:从知识库到自研 IDE 的复利实践 — joe0418 · 2026-08-15