Kimi K3 在安全基准上跑出 SOTA
cramforce · x · 2026-07-18
作者表示自己用 Kimi K3 跑了某个基准,结果显示它达到 SOTA 级别表现。 他补充说,某些更强的“fable class”模型因为不愿意做安全相关工作而不在讨论范围内;在这个基准上,Kimi K3 的召回率接近 Codex/GPT-5.5,严重性判断也调得类似 Opus 4.8。
所属事件:Kimi K3 安全强势但可靠性受疑(5 条相关)→
「编程与Agent」频道最新
- 一个跟踪 Codex 额度的 CLI — bytebot · 2026-07-20
- Skippr 上线实时 AI 员工 — harshitagu72595 · 2026-07-20
- 管理大量编程 Agent 的控制平面 — victormustar · 2026-07-20
- Vercel AI 应用一行加 tracing — MarcusSchiesser · 2026-07-20
- Harness Handbook 按行为组织 agent 代码库 — AndLukyane · 2026-07-20
- 用行为数据个性化 AI Agent — Al_Grigor · 2026-07-20