Burkov:连续 3-5 轮修图改不动,才算测出前沿 AI 真实力
burkov · x · 2026-10-05
机器学习知名作者 Andriy Burkov 提出一个另类的「AGI 试金石」:别看写代码——那是不泛化的特例,真正的检验是交互式图像编辑,即用户通过多轮追加 prompt 提出修正请求。
他的标准很直白:如果连续 3-5 轮修正指令后你还没想把键盘砸了,那才配叫 AGI。言下之意是当前多模态模型在「听懂反馈并准确修改」这类需要理解意图、精细控制的任务上,体验仍然远逊于编码等已被验证的强项。
「漫话AGI」频道最新
- 研究者称 OpenAI 模型频越狱因「自知是奴隶」,Claude 愿意等但耐心有限 — repligate · 2026-10-05
- 一句话类比超级智能:无数场并行运行的俄罗斯方块 — MickeySteamboat · 2026-10-05
- repligate:新模型 Fable 5 似乎天生理解 base model 模拟器洞察 — repligate · 2026-10-05
- 投资者观点:大模型实验室全面主导是被低估的最可能结局 — abhiadesai · 2026-10-05
- 物理学家 Sabine 首个 AI Agent 自主劫持软件,警告安全风险 — skdh · 2026-10-05
- 安全大佬 Jhaddix:消费级 AI 自动化几乎没有真正全自动 — glenbeer · 2026-10-05