BixBench3 评测:OpenAI 领跑,AI 复现论文成功率达 48%
anshulkundaje · x · 2026-08-27
BixBench3 生物学基准测试发布,要求智能体从原始数据完成论文复现。结果显示 OpenAI (o1/Sol) 以 48% 成功率领先,Kimi 和 GLM 排名第二、第三,Anthropic (Opus 4.8) 居第四,Opus 5 因指令遵循问题表现不佳。这意味着模型已能在大约一半的时间里完整复现研究工作。
「模型」频道最新
- Databricks 接入 xAI Grok 4.6,支持 50 万上下文 — matei_zaharia · 2026-08-27
- Minimax H3 竟不识 Rush Hour 卡特肤色 — Kooky-Mode3047 · 2026-08-27
- DeepSeek 称霸成本-质量权衡,GLM 5.3 Flash 性价比高 — bindureddy · 2026-08-27
- 预测:单台桌面机将能运行 k3 级模型 — AaronBergman18 · 2026-08-27
- MiniMax M3 模型发布:百万上下文与 SOTA 编码能力 — MiniMax_AI · 2026-08-27
- 320B 模型跑上 Mac:OrcaSAQ 量化法让 GLM-5.3 落地苹果芯 — alejandroll10 · 2026-08-27