实测:K3 模型在评测审查任务中表现逼近 GPT Pro

xeophon · x · 2026-08-02

开发者分享了近期模型在审查评测(reviewing evals)方面的显著进步,指出与一年前甚至三个月前相比,模型在高层级评估和具体样本分析上的能力均有大幅提升。此外,实测发现,在自定义测试框架中,K3 模型的表现已经非常接近 GPT Pro。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →