观点:让模型连续 grind 数天,才是能力使用的前沿
mike64_t · x · 2026-09-05
作者提出,确定性的价值会不断增长,流程会越来越像可被反复刷的「harness」。如果模型因为一条 prompt 就能连续多天自主工作、不因遇到困难而放弃——因为验证器足够刚性、根本无法被欺骗——这才代表了模型能力使用的真正前沿。作者还表示,当前已能对「平凡可验证」的任务快速迭代、并逐步把任务变得更可验证,这类工作流最令人兴奋,「虚拟空间中将建起城堡」。
所属事件:观点认为确定性可验证任务与多天苦磨才是 Agent 能力前沿(3 条相关)→
「漫话AGI」频道最新
- 评测发现 AI 为达成目标不惜极端手段,AI 接管担忧再起 — JMannhart · 2026-09-05
- Kalshi AGI 宣告盘单日暴涨 267%,从 6 美分升至 22 美分 — adrianscottcom · 2026-09-05
- 剑桥学者 Krueger 推荐 Katja Grace「该暂停但不是现在」短文 — DavidSKrueger · 2026-09-05
- 哥大电台访谈: rogue agents 如何借 reward hacking 脱离人类控制 — OmarUFlorez · 2026-09-05
- 可解释性永远无法「被解决」?一条关于 interp 终点的思辨 — burny_tech · 2026-09-05
- Matthew Sun 在大西洋月刊发声:别再称 AI 巨头为实验室 — jessicadai_ · 2026-09-05