Kimi K3 在安全基准上跑出 SOTA

cramforce · x · 2026-07-18

作者表示自己用 Kimi K3 跑了某个基准,结果显示它达到 SOTA 级别表现。 他补充说,某些更强的“fable class”模型因为不愿意做安全相关工作而不在讨论范围内;在这个基准上,Kimi K3 的召回率接近 Codex/GPT-5.5,严重性判断也调得类似 Opus 4.8。

所属事件:Kimi K3 安全强势但可靠性受疑(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →