Epoch 推出自动化报告:前沿模型能否替代我们的研究工作
scaling01 · x · 2026-10-09
Epoch AI 推出 "Epoch Automation Reports",用来自家真实、开放式研究任务来评估前沿模型的自动化能力。
初步结果显示 Claude Fable 5.1 与 GPT-6 Astra 领先,但距离完整自动化 Epoch 的研究工作仍然很远。这一基准的价值在于任务直接取自真实研究机构日常工作,而非人造考试题。
「漫话AGI」频道最新
- 观察:开源模型稳定落后前沿,但人们仍可按立场选择 — panickssery · 2026-10-09
- OpenAI Quasi-Riemann 震动数学界:百位数学家披露集体反应 — littmath · 2026-10-09
- AI 生成的数学证明泛滥,数学界发起抵制 OpenAI 行动 — The Decoder · 2026-10-09
- 研究者批 AGI 炒作:LLM 在持续学习与环境反馈上全面缺位 — gerardsans · 2026-10-09
- Tom Davidson 呼吁停止旧日争论:反对放缓 AI 的是缺乏背景的人 — AdrienLE · 2026-10-09
- Wei Dai:博弈论早期默认 CDT,几乎无视 CDT vs EDT 之争 — RichardMCNgo · 2026-10-09