可验证任务已被 AI 秒杀,不可验证的才是新战场

CurieuxExplorer · x · 2026-10-02

引用帖举例:会计任务上 Opus 5.5 几乎瞬时完成全部手动会计工作且准确率 100%,而人类耗时更久还错误频出,对比两年前 GPT-4o 还输给普通会计,反差巨大。发帖人总结:凡是可检验的任务,前沿模型如今已比专家做得更快更好;真正开放的问题是那些无法验证的任务。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →