LLM 缺乏「幂等性」:复查自己的大代码库会自相矛盾

StephanSturges · x · 2026-10-07

AradhyeAgarwal 指出一个普遍现象:让 Claude/GPT 编写或审计一个大型代码库,然后再让它复查,它几乎必然会得出与之前矛盾的结论。作者认为「幂等性」(idempotency)是任何系统的关键性质,而当今 LLM 恰恰缺失——同样的输入在多轮对话中无法得到一致的输出。他建议把这个现象做成一个 benchmark 来系统衡量模型的自洽性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →