Kimi K3、GPT-5.6 Sol 和 Fable 5 同台跑完 6 个新闻任务
local___host · reddit · 2026-07-24
这篇新闻编辑实验把 Claude Fable 5、GPT-5.6 Sol 和 Kimi K3 放在同一套数据密集型 newsroom 任务里对比,六个事件都使用相同的资料包、并且不能联网。
结果很清楚
- Fable 5 最像一名强编辑:它能补回其他模型遗漏的采访细节、方法说明和上下文,但 6 篇里有 5 篇超出了 600 字限制。
- GPT-5.6 Sol 最守规矩:长度和格式全都合格,但文风更像 wire service,偏平、偏列表化,还会频繁在行文里注明来源。
- Kimi K3 像是“会把能想到的都写进去”的记者:结构扎实、数字丰富,但 6 篇里有 4 篇同样超字数。
运行层面的意外
- 在最初 16,000 token 的 completion 上限下,6 次里有 3 次把预算几乎全花在 reasoning 上,文章都没写完。
- 一个 Tour de France 任务甚至在加倍预算后仍然先跑满 reasoning,最后只能在受限推理设置下完成。
图表与事实核验
- 作者放开了图表类型白名单,发现图表词汇本身会影响编辑决策。
- 三个 frontier 模型一共生成了 218 个数值图表值,核验后没有发现伪造的数值。
- 但有一个额外审计指出:Sol 的某张图里,字符串标签中的温度基线写错了;因此“零伪造”只适用于数值,不覆盖所有字符串字段。
「模型」频道最新
- AI 日报:传 OpenAI GPT-Live-1 上 API,Pro 订阅暂停新注册 — koltregaskes · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11