9B 开源模型换入云端 Agent 系统,准确率从 96% 跌至 62.3%
TheZachMueller · x · 2026-09-30
Lambda 发布 Open Jarvis 研究:把一个 9B 开源权重模型(Qwen3.5-9B)直接放进为前沿云端模型(Claude Opus 4.6)调优的 agent 系统里,在 PinchBench(衡量 LLM 作为 OpenClaw agent 大脑的表现)上准确率从 96.0% 掉到 62.3%。
问题不在模型本身,而在 harness——即告诉模型做什么、能用哪些工具、如何从错误中学习的整套配置。围绕本地模型重新调整量化、推理循环、工具访问与记忆后,准确率回升到 88.4%,仅靠调 harness 就补上了 77% 的差距,尚未叠加进一步的 spec 搜索优化。
Open Jarvis 的核心是一份针对特定模型与运行机器定制的 spec,包含五个可独立配置的原语(Intelligence、Engine、Agent、Tools & Memory 等),可用前沿云端模型诊断失败并自动提出修改。研究开源,在 Lambda GPU 上评测。
「编程与Agent」频道最新
- Agent 身份验证初创 Beltic 出 stealth,获 880 万美元融资 — alifcoder · 2026-10-01
- 分析师:OpenAI 商城不强制用其推理,或绕开平台变现杠杆 — matt_slotnick · 2026-10-01
- 为 Astra 的「谨慎」辩护:会停下来提问的 Agent 才好用 — brandon_galang · 2026-10-01
- Gemini 上线 Skills:一套指令存成快捷方式,反复任务免重复 prompt — GeminiApp · 2026-10-01
- LangChain 发布 LangSmith Engine v2,可主动红队测试你的 Agent — LangChain · 2026-10-01
- AI 上下文层产品 HQ 正式发布,近千家企业已在用它运营业务 — jacob_posel · 2026-10-01