9 个模型答对仅 1 个:套上 RLM harness 后全部答对
PawarBI · x · 2026-09-27
微软 Fabric 团队的 Sandeep Pawar 发文《Fabric RLM: Why Harness Matters》,用一个例子说明给模型配 harness(工作环境)比换模型更有效。
- 实验:问「一周七天里有几天名字含字母 d?」(答案是 7)。直接问 9 个来自 OpenAI、Mistral、Google、Qwen 的中小模型,8 个答错(只对 1/9);同样的问题通过 Fabric-RLM 问,9 个全部答对(9/9)。作者还补了 gpt-5.6-sol 的结果作对照。
- 原因:LLM 读的是 token 而非字母,"Monday" 是一两个 token 而不是六个字符,模型是在根据 token 记忆猜答案,属于模型「看文本方式」的盲点而非知识缺失。
- 做法:Fabric-RLM 不给模型额外知识,而是给它一个可工作的场所——Python 工作空间和循环,让模型能实际执行代码来数字母。
- 结论:模型没变,改变的是使用模型的方式,harness 的设计至关重要。
「编程与Agent」频道最新
- 微软开源 SkillOpt:不改权重,用 Markdown 技能文件提效 23 分 — sanjaykalra · 2026-09-27
- 开发者用 DGX Station 让本地模型做 CAD,邀 SF 同好一起 hacking — hudzah · 2026-09-27
- Agent 控制平面设想:模型提议、控制层决策,不给模型常驻写权限 — brucemacv · 2026-09-27
- SlopOps:别把 AI 能力当竞争优势,1000 个半成品只会归零 — generativist · 2026-09-27
- 容器化应用部署 DevOps 完整课程免费分享 — _jaydeepkarale · 2026-09-27
- 机器学习工程师的 Docker 实用指南资源合集 — _jaydeepkarale · 2026-09-27