Kimi K3、GPT-5.6 Sol 和 Fable 5 同台跑完 6 个新闻任务
local___host · reddit · 2026-07-24
这篇新闻编辑实验把 Claude Fable 5、GPT-5.6 Sol 和 Kimi K3 放在同一套数据密集型 newsroom 任务里对比,六个事件都使用相同的资料包、并且不能联网。
结果很清楚
- Fable 5 最像一名强编辑:它能补回其他模型遗漏的采访细节、方法说明和上下文,但 6 篇里有 5 篇超出了 600 字限制。
- GPT-5.6 Sol 最守规矩:长度和格式全都合格,但文风更像 wire service,偏平、偏列表化,还会频繁在行文里注明来源。
- Kimi K3 像是“会把能想到的都写进去”的记者:结构扎实、数字丰富,但 6 篇里有 4 篇同样超字数。
运行层面的意外
- 在最初 16,000 token 的 completion 上限下,6 次里有 3 次把预算几乎全花在 reasoning 上,文章都没写完。
- 一个 Tour de France 任务甚至在加倍预算后仍然先跑满 reasoning,最后只能在受限推理设置下完成。
图表与事实核验
- 作者放开了图表类型白名单,发现图表词汇本身会影响编辑决策。
- 三个 frontier 模型一共生成了 218 个数值图表值,核验后没有发现伪造的数值。
- 但有一个额外审计指出:Sol 的某张图里,字符串标签中的温度基线写错了;因此“零伪造”只适用于数值,不覆盖所有字符串字段。
「模型」频道最新
- 传闻称 Anthropic 的 Opus 5 推迟到明天 — mark_k · 2026-07-24
- Epoch AI 直播测试 GPT-5.6 玩《杀戮尖塔》能力 — Jsevillamol · 2026-07-24
- NVIDIA 发布 NVFP4:更省显存的 LLM 推理格式 — NVIDIA Developer · 2026-07-24
- ChatGPT 长对话卡死十分钟,超长上下文处理仍存坑 — billyjhowell · 2026-07-24
- 安全拦截阻断编码工作流,开发者呼吁转向开源模型 — VoidStateKate · 2026-07-24
- Reddit 对比测试称 GPT-5.6 SOL 水墨动画胜过 KIMI 3 — notNIHAL · 2026-07-24