9B 开源模型换入云端 Agent 系统,准确率从 96% 跌至 62.3%

TheZachMueller · x · 2026-09-30

Lambda 发布 Open Jarvis 研究:把一个 9B 开源权重模型(Qwen3.5-9B)直接放进为前沿云端模型(Claude Opus 4.6)调优的 agent 系统里,在 PinchBench(衡量 LLM 作为 OpenClaw agent 大脑的表现)上准确率从 96.0% 掉到 62.3%。

问题不在模型本身,而在 harness——即告诉模型做什么、能用哪些工具、如何从错误中学习的整套配置。围绕本地模型重新调整量化、推理循环、工具访问与记忆后,准确率回升到 88.4%,仅靠调 harness 就补上了 77% 的差距,尚未叠加进一步的 spec 搜索优化。

Open Jarvis 的核心是一份针对特定模型与运行机器定制的 spec,包含五个可独立配置的原语(Intelligence、Engine、Agent、Tools & Memory 等),可用前沿云端模型诊断失败并自动提出修改。研究开源,在 Lambda GPU 上评测。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →