多方模型审计横评:Astra 屠榜,Opus 紧随,Grok 与 GPT-6 大幅落后

ivan_bezdomny · x · 2026-09-25

X 用户 theo 分享了一次审计能力横评:让多个新模型分别做大规模审计任务,再组建评委小组对各模型的审计质量排名。结果显示 Astra 遥遥领先,Opus 和 Fable 紧随其后,而 Grok 4.7 和 GPT-6 Sol 大幅落后。

转发者 ivanbezdomny 补充称这与他的体验一致:Astra 写的代码很差,但在评估与对比类任务上表现远好于其他模型。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →