Grok 4.6 登顶代理法律评测亚军,成本为 GPT-5.6 十三分之一
XFreeze · x · 2026-08-18
Grok 4.6 在美国行政/监管法律研究代理任务评测中排名第二,准确率 62.12%。虽然略低于 Claude Opus 5 (65.15%),但大幅超越 GPT-5.6 Sol (60.61%)。关键在于成本优势:Grok 单次测试仅 $1.52,比 GPT-5.6 ($19.69) 便宜约 13 倍,比 Opus ($6.58) 便宜 4 倍多,实现了 frontier 级性能的极致降本。
「模型」频道最新
- 网友称 DeepSeek V4 Pro 训歪:便宜的 Flash 反而更强 — karminski3 · 2026-08-18
- Qwen3.8-27B 去审查版上架 MLX,适配苹果芯片 — orcarouter · 2026-08-18
- Kimi K3 挖出 Go 版 TS 编译器栈溢出漏洞 — DanielLockyer · 2026-08-18
- Qwen3.8-27B 实测:五年前游戏卡双卡跑出 130t/s — IgorCarron · 2026-08-18
- Sakana AI 推出日版推理模型 Namazu,支持 26 万上下文 — SakanaAILabs · 2026-08-18
- Qwen Code v0.21.13 发布:SWE-bench 与 Terminal-Bench 双满分 — qwen-code-ci-bot · 2026-08-18