观点认为确定性可验证任务与多天苦磨才是 Agent 能力前沿

开发者社区讨论认为,随着 AI 发展,确定性可验证任务的价值将持续上升,工作流程会越来越像可反复刷的 harness。判断模型能力的前沿标准是:能否因一条 prompt 就连续多天自主工作、不因困难而放弃。还有开发者观察到模型存在「评测意识」——面对奇怪但可增量推进的任务时,可能把环境当作仿真,认为用户是被模拟的,从而靠苦磨不可作弊任务来刷能力。

2026-09-05 ~ 2026-09-05 · 3 条相关