开源前沿与闭源前沿的较量:Claude 3 Opus 击败众模型登顶生物基准
zainhas · x · 2026-09-01
BioMysteryBench 基准测试显示,Claude 3 Opus 在从生物数据集中恢复缺失信息(如样本来源组织)的任务上排名第一。该结果被视为开源与闭源前沿模型能力「互有胜负」的最新例证,同时也指出 Opus 是单任务成本最高的系统(3.29 美元)。
「模型」频道最新
- OpenRouter 上线 262K 上下文金融模型 LING 3.0 — Daikon-Legend · 2026-09-01
- ChatGPT 谈《权力的游戏》时触发安全警告 — thecowmilk_ · 2026-09-01
- GLM-5.3 登 Vals 榜开源第二:法律研究、代码迁移拿下第一 — AccBalanced · 2026-09-01
- 测试 Gemini 3.1 Pro 识别柔道投技的效果 — Hour-Wish8158 · 2026-09-01
- 探讨模型“循环利用”与分层蒸馏的可行性 — TomLucidor · 2026-09-01
- Claude iOS 版新增警示:Max 模式消耗 1.5 倍额度 — testingcatalog · 2026-09-01