受验证工具调用让家庭能源 agent 逼近优化器 96.7%–98.0% 节省
MaryamMiradi · x · 2026-07-25
英国 Centre for Computational Science 的这个项目展示了:家庭能源 AI agent 要想安全落地,关键不是让模型“说会了”,而是让它通过受验证的工具调用真正执行。
关键结论
- 系统会把用户自然语言请求拆成硬约束与软偏好,例如截止时间、时长、功率上限和可调度窗口。
- 它会先抓取电价、天气、光伏预测等实时数据,再决定如何安排充电、洗衣机和洗碗机。
- 在结构化工具调用下,GPT、Gemini、Claude 都实现了 100% 的调度成功率;纯文本式动作明显不可靠。
- 以一周仿真来看,agent 能拿到优化器 96.7%–98.0% 的节省效果,年化约 £1,270,明显优于固定低谷电时器。
生产化启示
- LLM 负责翻译意图
- 工具负责计算可行性
- 确定性安全门 决定是否允许执行
- 没有验证通过的 tool call,就没有真实世界动作
「编程与Agent」频道最新
- LLaDA2.2 把多轮 Agent 真正瓶颈指向解码速度 — Direct_Band896 · 2026-07-25
- Claude Opus 5 综合登顶,Fable 5 仍领跑编程代理 — Hesamation · 2026-07-25
- 微软 7 月 29 日在明尼阿波利斯办免费 Agent 黑客松 — WirelessLife · 2026-07-25
- Opus 5 提示词指南:别再显式要求自检了 — cedric_chee · 2026-07-25
- Claude Opus 5 已登陆 GitHub Copilot 的 App、CLI 和 VS Code — DanWahlin · 2026-07-25
- Claude Opus 5 提供五档 effort,且默认开启推理 — rohanpaul_ai · 2026-07-25