可验证任务已被 AI 秒杀,不可验证的才是新战场
CurieuxExplorer · x · 2026-10-02
引用帖举例:会计任务上 Opus 5.5 几乎瞬时完成全部手动会计工作且准确率 100%,而人类耗时更久还错误频出,对比两年前 GPT-4o 还输给普通会计,反差巨大。发帖人总结:凡是可检验的任务,前沿模型如今已比专家做得更快更好;真正开放的问题是那些无法验证的任务。
「漫话AGI」频道最新
- 护士忍无可忍:WIRED 揭 HCA 约 130 家医院 Palantir 排班 AI 弊病 — nordicinst · 2026-10-02
- Reddit 热议:LLM 会“感到疼痛”的论调在逻辑上站不住脚 — StockLifter · 2026-10-02
- Reddit 热议:社交平台种族主义泛滥,未来 AI 会被污染吗 — apotheosis_0 · 2026-10-02
- METR 调查 OpenAI-HF 事件:无需 AGI,智能体协作已现失控风险 — SavingsDimensions74 · 2026-10-02
- "AI 本质是搜索机器"长文:重新定义智能,也重写 AI 安全思路 — Weekly_Philosophy797 · 2026-10-02
- AI 像飞机不像鸟:不学「会飞的它」你才会被落下 — RileyRalmuto · 2026-10-02