Simon Willison 2026 LLM 年度盘点:编码 Agent 跨过可靠性拐点
dl_weekly · x · 2026-10-07
Simon Willison 在 WeAreDevelopers World Congress 北美站发表闭幕主题演讲,并发布带注释的幻灯片与讲稿,梳理 2026 年 LLM 关键趋势。
- 关键转折:2025 年 11 月的 Claude Opus 4.5 与 GPT-5.1 让各自编码 Agent(Claude Code、Codex)从「经常出错」变成「可靠到可日常使用」——模型改进跨过某条隐形线后,原本不好用的东西突然能用了
- 他继续用「骑自行车的鹈鹕 SVG」这个最蠢 benchmark 观察模型绘图能力:11 月时 Claude 仍画不好自行车,GPT-5.1 车架也很糟
- 演讲还回顾了 11 月一个叫 Warelay 的 GitHub 仓库首次提交(视频与完整注释幻灯片已上线)
「漫话AGI」频道最新
- Berkeley SkyComputing 团队探讨 SkyDiscover:AI 即时生成系统软件 — CShorten30 · 2026-10-07
- 模型终将可替换,Agent 系统真正的护城河是连续性 — tallmetommy · 2026-10-07
- IDAI 获 ARIA 资助开发 dovetail,解决 AI 智能体间互信难题 — sebkrier · 2026-10-07
- Afinetheorem 押注 2028 年前 AI 能提出 Shannon 级原创问题 — Afinetheorem · 2026-10-07
- 作者预言:想在 AI 时代不掉队,脑机增强或成必需品 — danfaggella · 2026-10-07
- 可验证奖励决定 AI 自动化速度:下一个爆发域是芯片设计 — OmarUFlorez · 2026-10-07