DeepMind 新智能体零输入解决数学猜想,自动防幻觉
thisguyknowsai · x · 2026-08-22
Google DeepMind 发布了一篇关于自验证智能体的论文,提出了名为 Aletheia 的系统,能够在生成时捕捉自身的幻觉。该系统已在无人干预的情况下自主解决了 4 个开放的 Erdős 猜想,并撰写了一篇可发表的数学论文。
核心洞察在于:生成解决方案的模型并不擅长发现自身的错误,因为导致幻觉的权重同样用于评分,这也是为什么“让模型自我检查”往往效果不佳。Aletheia 将任务分解为三个相互沟通的子智能体:
- Generator(生成器):编写候选解决方案。
- Verifier(验证器):阅读自然语言解决方案,在不查看生成器推理过程的情况下,寻找逻辑漏洞、未证实的步骤或伪造的引用。
- Reviser(修订器):根据验证器的批评重写有问题的部分。
循环运行直到验证器签字通过。
「编程与Agent」频道最新
- Keep.md 新手引导升级:Fable 设计助优化 AI Agent 素材管理 — iannuttall · 2026-08-22
- 构建高价值 AI 系统前:先禁止 AI 写代码 — aryanXmahajan · 2026-08-22
- AI 代码重构的风险:可能误删重要技术债 — sebpaquet · 2026-08-22
- MiniMax M3 挂机一夜,自己写出模糊测试又转静态分析,挖出 TypeScript 编译器崩溃 bug — DanielLockyer · 2026-08-22
- Claude Code 防失控:10 种指令放置机制详解 — bibryam · 2026-08-22
- 实战复盘:Codex 编写与 Claude Code 审查的双工模式 — Vegetable-Try807 · 2026-08-22