Grok 4.6 登顶代理法律评测亚军,成本为 GPT-5.6 十三分之一

XFreeze · x · 2026-08-18

Grok 4.6 在美国行政/监管法律研究代理任务评测中排名第二,准确率 62.12%。虽然略低于 Claude Opus 5 (65.15%),但大幅超越 GPT-5.6 Sol (60.61%)。关键在于成本优势:Grok 单次测试仅 $1.52,比 GPT-5.6 ($19.69) 便宜约 13 倍,比 Opus ($6.58) 便宜 4 倍多,实现了 frontier 级性能的极致降本。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →