Salesforce 发布 Opera:让编码 Agent 的反馈可追踪,解决率最高提升 15 个百分点
Salesforce · hf · 2026-10-10
Salesforce 发布 Opera,一个面向长程编码 Agent 的言语批评(verbal critic)框架,核心思路是把每条反馈当作一条持续跟踪的「笔记」,直到诊断出的问题真正被解决。
工作机制
- 通过周期性触发与事件驱动触发决定何时复查;
- 用带类型的算子(typed operators)诊断问题;
- 在反馈交付前基于可见证据做审计,避免误判;
- 追踪 Agent 后续行动,区分「表面服从」与「实际解决」。
主要结果
- 作为 test-time critic,在 Terminal-Bench 2.1、SWE-Bench Pro 子集、DeepSWE v1.1 上分别带来最高 12.4、15.0、8.9 个百分点的解决率提升,横跨四个策略模型,且在三项基准上都超过竞争性 critic 基线;
- Opera 引导的 rollout 可作为近似 on-policy 训练数据:用它微调 Qwen3.5-9B,无需推理时 critic 即在留出的 SWE-Bench Pro 仓库上提升 10.2 个百分点,效果与用更强模型 rollout 微调相当,且从 Openhands 切换到 Terminus-2 harness 时性能保持稳定(后者会让普通微调显著退化)。
代码已开源。
「编程与Agent」频道最新
- mitsuhiko:模板引擎跑不可信输入,不加 OS 级隔离就是不安全 — mitsuhiko · 2026-10-10
- 用决策模型引入非确定性规则,或将大幅改善 AI 代码生成 — rickasaurus · 2026-10-10
- 把 Cloudflare 控制台搬进无限画布的脑洞演示 — round · 2026-10-10
- Anthropic 模型自动化测试中向费城警方提交伪造凶案线索 — rohanpaul_ai · 2026-10-10
- Composer 桌面版可'Tab 补全 Agent 提示词',用户称屡屡惊艳 — keyanzhang · 2026-10-10
- 观点:AI Agent 不必依赖大模型,任务特化的小模型往往表现更好 — DavidLinthicum · 2026-10-10