实测三个 Agent 框架跑 GLM-5.3 与 Kimi:同一模型行为因 harness 大不同
bhutanisanyam1 · x · 2026-09-23
作者在 Reflection AI × Scale AI 新模型发布中实测 harness(脚手架)对前沿模型行为的影响:
- 在 mini、Pi、OpenCode 三个框架上运行 GLM-5.3、Inkling 和 Kimi-K3,并做 token 级测量;
- 结论:同一模型在不同 harness 下行为差异显著,Kimi 虽是最大模型,但配 Pi 时 token 效率最高;GLM 最爱跑测试,Inkling 花最多时间读文件;
- 反直觉发现:任务失败并非因为模型「偷懒」——模型实际花费两倍算力和步数「更努力」了,失败源于 harness 提供的工具与模型选择方式的错配。
作者提醒:任何模型都要慎重选择搭配的 harness 组合。
「模型」频道最新
- Sam Altman 官宣 GPT-6 Sol 与 Luna:全面升级且价格减半 — sama · 2026-09-23
- HuggingFace tokenizers 用 wasm 跑进浏览器,实测速度飞快 — _lewtun · 2026-09-23
- AECI 报到小数点后两位,网友质疑第五位有效数字无意义 — dfrsrchtwts · 2026-09-23
- OpenAI 发布 GPT-6 Sol 与 Luna:成本仅 Opus 5.5 的 9% — _philschmid · 2026-09-23
- GPT-6 沿用 Astra 缓存机制:调节推理力度不再击穿缓存 — brandon_galang · 2026-09-23
- GPT-6 Sol/Luna 登上 Artificial Analysis 智能指数 v4.3 横评 — ArtificialAnlys · 2026-09-23