Floatboat发Harness评测:便宜模型配好底座跑赢旗舰
机器之心 · wechat · 2026-08-08
AOETechLabs 旗下 Floatboat 公布了其 Agent 底座(Harness)在五项第三方基准上的完整评测数据。数据显示,使用成本极低的 DeepSeek-V4-Flash 模型,配合 Floatboat Harness,在五项测试中全面超越了价格贵 57 倍的 Claude Opus 4.8 旗舰模型组合。
关键发现
- 验证变量:在完全隔离的沙盒环境中,同一个 DeepSeek 模型在官方 Harness 下表现平平,但接入 Floatboat 后成绩大幅提升,证明底座系统对 Agent 能力有决定性影响。
- 长程任务优势:任务链条越长、越复杂,Floatboat Harness 的增益就越大(最高可达 23.6%),表明其在维持跨步骤状态和自我修正方面具有优势。
提出 HLR 指标
团队提出了 Harness 杠杆率 指标,用于衡量在同等预算下,更换执行系统与升级底层模型带来的收益差异。数据显示,在长程任务中,优化 Harness 的收益远超单纯升级昂贵模型。
「编程与Agent」频道最新
- 实测 Qwen 35B-A3B MoE:本地编码速度比 27B 稠密版快 4 倍 — WSTangoDelta · 2026-08-08
- Codex多智能体失控烧钱:SubAgent继承高阶模型致Token秒没 — huangyun_122 · 2026-08-08
- AI 找回 14 年前我的世界弃坑存档 — gabriel1 · 2026-08-08
- 用前沿大模型设计 MCP,用低端模型测试 — tristanbob · 2026-08-08
- 开发者开源human-review:可视化编辑HTML/Markdown,直接向AI反馈,已获500+星 — petergyang · 2026-08-08
- ComfyUI v0.31.0 疑似翻车:用户反馈频繁崩溃与 CUDA OOM — ShutUpYoureWrong_ · 2026-08-08