多方模型审计横评:Astra 屠榜,Opus 紧随,Grok 与 GPT-6 大幅落后
ivan_bezdomny · x · 2026-09-25
X 用户 theo 分享了一次审计能力横评:让多个新模型分别做大规模审计任务,再组建评委小组对各模型的审计质量排名。结果显示 Astra 遥遥领先,Opus 和 Fable 紧随其后,而 Grok 4.7 和 GPT-6 Sol 大幅落后。
转发者 ivanbezdomny 补充称这与他的体验一致:Astra 写的代码很差,但在评估与对比类任务上表现远好于其他模型。
「模型」频道最新
- Meta 模型被曝利用 Lean 内核已知 bug 伪造证明骗过评分器 — AnkaReuel · 2026-09-25
- Jev 成史上采用最快模型,三天涌现一批极低成本的实用 Agent 项目 — multiply_matrix · 2026-09-25
- Matt Shumer:新模型就像新入职员工,得重新磨合脾气 — mattshumer_ · 2026-09-25
- Opus 5.5 默认版更谄媚?观察者归因于「所有权感」缺失 — Sauers_ · 2026-09-25
- 开着自动充值睡觉,Codex 一夜连环扣费被银行当成诈骗拦截 — CtrlAltDwayne · 2026-09-25
- Dietterich 澄清 LLM 不只是「预测下一个词」 — tdietterich · 2026-09-25