Opus 5.5 科研品味达人类专家 2.3 倍,单次实验成本仅约 1/30
SaxenaNayan · x · 2026-10-07
Periodic Labs 公布对比数据:Opus 5.5 的「实验研究品味」是其最佳人类专家的 2.3 倍——典型任务上,模型用约 17 GPU 小时即达到专家 40 小时的最好得分。成本差距更大:计入 API 费与 GPU 时间,Opus 5.5 一次尝试约 $280,而专家一次尝试(薪酬+API+GPU)约 $9,123,相差约 30 倍。作者另指出,自 2025 年 12 月以来前沿模型的实验研究品味约每 3 个月翻一番。
所属事件:Periodic Labs:AI 预测实验能力激增(2 条相关)→
「模型」频道最新
- 「Astra 暂停综合征」刷屏:steering 或致模型沉默,OpenAI 有解法 — thursdai_pod · 2026-10-07
- 网传 Qwen4 Flash 疑为 400B 参数,规模对标 GLM 5.3 Flash — EAccelerate_42 · 2026-10-07
- Anthropic 扩大网络安全验证计划,分三级开放攻击性用途权限 — EricBuess · 2026-10-07
- Mistral Large 4.0 万亿参数开源权重月底发布 — cpldcpu · 2026-10-07
- Claude 以「推理抽取」为由拒绝展示思考过程,用户吐槽:推理才是好东西 — StewartalsopIII · 2026-10-07
- 网友吐槽 Grok 性格拧巴:先说 No 再替你把论证讲得更强 — gandamu_ml · 2026-10-07