Amazon 复盘 Karpathy AutoResearch:生产级跑了 12 周,暴露 5 类失败模式
amazon · hf · 2026-10-09
Amazon 团队将 Karpathy 提出的 AutoResearch 范式(LLM 迭代改写训练脚本、保留提升指标的改变)应用于生产级推荐系统嵌入优化,12 周内跑了 220+ 实验。报告发现五类原设定中不存在的失败模式:基础设施脆弱性、agent 记忆衰减、搜索方向停滞、迭代成本不对称、指标固着;并提出 prevent-persist-redirect 三原则脚手架设计。
关键结果:
- 两套独立表征学习系统上,Recall@6 提升 1.82 倍,coherence 提升 2.1 倍
- agent 自主设计纯文本 fallback,将目录覆盖扩大 5.8 倍
- 两系统单次迭代成本相差近三个数量级,却呈现相同失败模式,说明这些是生产级自主研究的结构性问题
「编程与Agent」频道最新
- Khan Academy 推出 MCP Server,AI 助手可免密读取课程与视频字幕 — modelcontextprotocol · 2026-10-09
- BAAI 发布研究智能体 AREX:逐条核验答案,BrowseComp 达 82.5% — DeepLearningAI · 2026-10-09
- 用户的 AI agent 自动帮他对比建筑报价单 — dkundel · 2026-10-09
- 16 个月前就断言:Claude Code 正把 agent 工作流和 API 花费吸向 Anthropic — majidmanzarpour · 2026-10-09
- Pydantic AI agent 循环移植到 Go:pydantic-ai-go 开源 — samuelcolvin · 2026-10-09
- 从只能干 10 分钟到常态长任务:Claude Code 一年间的能力跃迁 — majidmanzarpour · 2026-10-09