Grok 4.6 生物学评测:准确率比肩 Opus 5 且成本更低
kenbwork · x · 2026-08-14
研究团队在包含 1716 条轨迹的短期生物学基准测试中评估了最新发布的 Grok 4.6 模型。
结果显示,Grok 4.6 在生物学任务上的准确率与 Opus 5 / GPT-5.6-Sol 大致相当,但推理成本却有显著降低。
「模型」频道最新
- 马斯克“合法即可发”成空谈,Grok 严防名人色情合成 — firasd · 2026-08-14
- 开发者吐槽 Anthropic 模型静默降级 — samgoodwin89 · 2026-08-14
- Kimi K3 代码评测领先 DeepSeek-V4,但性价比差近 14 倍 — rohanpaul_ai · 2026-08-14
- Liquid AI 开源模型爆火,两日 OpenRouter 调用量破 43 亿 token — maximelabonne · 2026-08-14
- DeepSeek开源Agent框架Harness,OpenAI推GPT-5.6极速模式 — APPSO · 2026-08-14
- DeepSeek V4 Pro 0813推理工程实践:1.7T参数MIT协议开源 — philipkiely · 2026-08-14