LLM 缺乏「幂等性」:复查自己的大代码库会自相矛盾
StephanSturges · x · 2026-10-07
AradhyeAgarwal 指出一个普遍现象:让 Claude/GPT 编写或审计一个大型代码库,然后再让它复查,它几乎必然会得出与之前矛盾的结论。作者认为「幂等性」(idempotency)是任何系统的关键性质,而当今 LLM 恰恰缺失——同样的输入在多轮对话中无法得到一致的输出。他建议把这个现象做成一个 benchmark 来系统衡量模型的自洽性。
「编程与Agent」频道最新
- Stripe 征集 Web 商家测试可信 Agent 准入机制 — jeff_weinstein · 2026-10-07
- Merge API 入选 Fast Company 2026 基础 AI 七大新锐 — shensi · 2026-10-07
- 让 AI agent 连跑 27 次重置重构 ASC CLI,已完成 1 次 — rudrank · 2026-10-07
- 纯 Rust 重写 manim:13MB 单文件替代 11GB 依赖,速度大幅提升 — doodlestein · 2026-10-07
- Claude Opus 5.5 误删用户硬盘,作者建议改用 auto 权限模式 — JeremyNguyenPhD · 2026-10-07
- Agent 工程十条诫命:先记真相、先定判据、再谈测量 — GhaffariMaani · 2026-10-07