Kimi K3 的 harness 影响很大
victormustar · x · 2026-07-20
Kimi K3 让作者开始关注不同的 **harness**:同一个任务,换不同工具链/评测框架,效果可能从“糟糕得离谱”变成接近 Fable 级别。 被引用内容提到,Kimi K3 在 Boeing 747 相关结果上“很惊艳”,优于 Opus-4.8,但仍不如 Fable。作者的核心意思是:模型表现会被 harness 显著影响。
所属事件:Kimi K3 评测成绩两极分化,工具链影响显著(5 条相关)→
「模型」频道最新
- 韩国初创模型在 AAII 得 44 分,接近 DeepSeek V4 Pro — JungWooHa2 · 2026-07-21
- 有人预测 OpenAI 的 GPT-6 会比 Fable 高效得多 — bindureddy · 2026-07-21
- Moonshot 重点推出 Kimi K3 与 API 平台 — pstAsiatech · 2026-07-21
- Motif 3 Beta 上线 Hugging Face,韩国基础模型竞赛继续升温 — Secure_Smoke_4280 · 2026-07-21
- Sakana AI 的 Fugu-Cyber 更新在安全基准上领跑 — SakanaAILabs · 2026-07-21
- Mythos 发布被类比 o1:限量放出后又被开源复现 — nptacek · 2026-07-21