Grok 4.5 安全评测表现不错

zeeg · x · 2026-07-11

作者表示,虽然自己还没用 GPT-5.6 跑同样测试,但他认为 5.6 和 5.5 的差异可能没那么关键,且现在做横向对比更难;他目前仍在用 Sonnet 4.6,考虑因价格/准确率权衡改用 Grok。\n\n被回复内容提到:Grok 4.5 在 Warden 的 security review benchmark 上表现很好,虽然有一定速度偏慢的问题,但成本和准确率都不错;在性能表现上,作者称其超过了自己测试过的所有 Opus 模型。

所属事件:Grok 4.5 评测:中高预算段性价比突出(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →