Kimi K3 在 UK AISI 1 亿 token 评测中或被低估
morqon · x · 2026-07-27
这条帖认为,Kimi K3 在 UK AISI 的评测里可能没有被充分“激发”出能力。
- UK AISI 的评测预算是 1 亿 token(包含 cache hits),作者认为很多分数在这个预算内还没真正到平台期。
- 他把 Kimi K3 描述为 token 效率不高 的模型,并推测如果给到 5 倍预算,表现可能会更好。
- 在他自己的渗透测试评测里,Kimi K3 的表现据称介于 Opus 4.8 和 GPT 5.6 Sol 之间。
- 结论是:它还不能直接替代现有方案,但作为后训练基础很有潜力。
所属事件:Kimi K3 网络安全能力突出但受限于 token 效率(2 条相关)→
「模型」频道最新
- Opus 5.5 与 GPT-6 Sol/Luna 一夜齐发,OpenAI 价格砍半抢市场 — AlchainHust · 2026-09-23
- 实测者称 Claude Opus 5.5 拥有迄今最好的视觉设计能力 — repligate · 2026-09-23
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23
- 研究者观察:爱晒AI吹捧自己的多是反社会行为者 — repligate · 2026-09-23
- 评Opus 5.5:语料满是摘要的摘要,一手经验最稀缺 — mimi10v3 · 2026-09-23
- Claude Opus 5.5 登 FrontierSWE 第二名,62.3% 仅次于 GPT-6 Astra — scaling01 · 2026-09-23