Teknium:想跨 harness 表现稳,就用多个 harness 训练
Teknium · x · 2026-09-07
有人抱怨模型越来越难与其原生评测 harness 分离(团队对每个工具描述和 system prompt 都精雕细琢),Teknium 回应称解法就是用多个 harness 训练:中国系模型、Fable 乃至 Muse 都能在不同 harness 间表现良好。
这揭示了一个行业现象:前沿模型与其原生评测/推理框架的耦合越来越深,而开源训练社区已有多 harness 混训的成熟实践。
所属事件:OpenAI 模型被指过度绑定原生 harness,换框架表现崩塌(3 条相关)→
「模型」频道最新
- GPT-6 Astra 用红石造出可运行的 RGB 显示屏,还自带背景音乐 — Angaisb_ · 2026-09-08
- GPT-6 Astra 睡前一条 prompt 自主挖到钻石,OpenAI 老 RL 老兵感慨 — mcleavey · 2026-09-08
- Claude Fable 5.1 系统提示词解析:从禁用列表到「热修复」式迭代 — dbreunig · 2026-09-08
- Reddit 热议:前沿模型领先本地模型仅约 6 个月 — Anxious_Current2593 · 2026-09-08
- ChatGPT 检索系统泄露:一次提问暗跑 18 条隐藏查询调 50 次引擎 — metehan777 · 2026-09-08
- 用户喊话 Anthropic:Fable 5.1 再好,也想要回正常说话的 Opus — james_mtc · 2026-09-07