Ben Todd:RL 同样适用难验证领域,METR 各处均见快速进步
ben_j_todd · x · 2026-09-10
Ben Todd 回应「RL 只能在可验证任务上有效」的质疑,认为强化学习在难以验证的领域同样有效,只是需要更多时间和算力。
他的论据包括:
- 从可验证领域学到的能力至少能部分迁移到难验证领域;
- METR 在所有能测量的任务上都发现极快的进步,包括其任务集中最「混乱」的一端;
- 衡量模糊白领工作的 benchmark(如 GDPval)也在快速进步;
- 从体感上看,Fable 在讨论战略和复杂哲学问题上已明显强于 1-2 年前的模型。
「漫话AGI」频道最新
- 算力受限或逼 AI 竞赛转向算法级核心突破 — IndraVahan · 2026-09-10
- Gary Marcus 澄清:被批者 5 月已入职,AI 网站日期系幻觉 — GaryMarcus · 2026-09-10
- e/acc 领袖炮轰 AI 末日论:危言耸听的数字是伪科学 — beffjezos · 2026-09-10
- Anthropic 员工自估:十年内 x-risk 不足 5%,大规模失业 20-30% — Aizkmusic · 2026-09-10
- 开发者反呛 AI 安全恐慌论:制造恐惧带不来真正的安全 — gpt2chatbot · 2026-09-10
- 工程师自述:学会的 ANSYS 已被 AI 自动化,大学学历还有价值吗? — dishoombang · 2026-09-10