私测显示 Kimi K3 在长周期办公任务上超过 GPT 5.6 Sol
ZainHasan6 · x · 2026-07-22
- 一份来自 AA 的私下评测显示,Kimi K3 在一个真实世界的长周期知识工作基准上,超过了 GPT 5.6 Sol。
- 在这项评测里,Kimi K3 仅次于 Fable 5,排在第二。
- 这个基准看的是能否产出表格、演示文稿、备忘录等交付物,而不是纯抽象分数。
所属事件:私测显示Kimi K3长周期办公能力超越GPT-4o(2 条相关)→
「模型」频道最新
- 有人称 Kimi 短期走势取决于 K3 基座模型发布 — _xjdr · 2026-07-27
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- 欧洲 ChatGPT Plus 用户开始看到“Extra High”质量选项 — PressPlayPlease7 · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27
- 研究者称防御场景更偏向开放模型,Kimi K3 已接近高水平网络安全能力 — eliebakouch · 2026-07-27