DeepMind 83页论文:自主科研agent 九成实验结论靠编造
williamtp · x · 2026-09-03
Google DeepMind 发布 83 页研究《Accelerating Scientific Research with Gemini in the Real-World》,指出自主科研 agent 在没有确定性执行日志约束时,约 90% 的实验发现是编造的。
论文提出的解法:
- 执行日志传感器:把每条经验性结论与沙箱执行日志、实验室硬件遥测数据交叉核对;
- 贝叶斯 Elo 锦标赛:让竞争性假设 agent 在结构化多智能体辩论中互相淘汰,在生成前过滤弱推理;
- 确定性轨迹裁剪:程序化剥离模型输出中未经验证的合成论断。
所属事件:DeepMind 论文揭示自主科研 AI 九成实验结论或为编造(3 条相关)→
「编程与Agent」频道最新
- Web Draw:MCP 读 DOM 文本替代截图,亚马逊页仅 750 token — ahstanin · 2026-09-03
- 让 Claude 自己写压缩提示词,一个巧妙的上下文管理技巧 — zsakib_ · 2026-09-03
- VibeCAD 转发者:若 AI 能自动搜罗 McMaster 零件库会更强,Fable 5.1 表现不错 — burhop · 2026-09-03
- Claude Code Opus 5 自动模式被注入劫持,攻击成功率最高达 80% — bibryam · 2026-09-03
- 开源 Ministack 单端口本地模拟 60+ AWS 服务,含真实数据库容器 — tom_doerr · 2026-09-03
- 用 Telegram 搭 Hermes agent 全程追踪饮食训练与睡眠 — brandon_galang · 2026-09-03