95%单步可靠性的Agent,30步任务完整成功率仅约21%
Scobleizer · x · 2026-09-08
Scobleizer 转述 VC18z 对 agentic software 论文/论点的冷静反方分析,回应了「Agent 无所不能」的常见 demo 印象:
- 可靠性算术:单步 95% 的可靠性下,30 步任务只有约 21% 能不出错地完整跑完,长链条 agent 的误差累积是硬伤。
- 验证成本:verification 可能吃掉 agent 带来的速度优势,人审抵消自动化收益。
- 写权限风险:一旦给 agent 写权限,它就从助手变成基础设施,攻击面显著扩大。
- 生态位问题:Salesforce、GitHub、Jira 等已有系统早已占据工作流,agent 到底是新的软件层,还是旧层之上的新 UI?
作者认为这是未来 24 个月 agentic 软件投资判断的核心问题。
「编程与Agent」频道最新
- DHH 的 Omarchy Linux 获 1550 万美元成立基金会,主打智能体排障 — vista8 · 2026-09-08
- CROCODIL 解决多 LLM 协作时「过度修改无关代码」问题 — jessyjli · 2026-09-08
- 用 Grok Bot 在 Figma 自动生成三联照片马赛克,设计苦活省 90% — mattyp · 2026-09-08
- x402 让智能体学会经济推理:每次调用都带价格标签 — kleffew94 · 2026-09-08
- 用 qwen3.8:27b 给小说做连续性审校,顺手造了个 git hook — walkingriver · 2026-09-08
- 开源 CLI hangnone:静态扫描 CI 里会卡死或静默失败的 Claude Code 调用 — Obluness · 2026-09-08