AQuA论文提出评测契约清单:改个工具schema就算新系统
creditme7 · reddit · 2026-08-28
围绕arXiv预印本AQuA(v2,未经同行评审)的讨论提出一个核心问题:如果agent能修改自己的工具schema、重试策略或参数定义,权重不变还算同一个系统吗?AQuA的泄漏分类学区分两类问题——agent利用未来信息的生成泄漏,与自适应搜索中反复读取评测指标造成的选择泄漏。
AQuA用密封沙盒与注册表把数据划分、特征、标签和评测器放在agent可编辑面之外;其Part II实验用配置DSL,一次diff只改架构/损失/采样器/优化器,数据路径与评测器固定,2021–2025美股窗口仅留作最终评测。预印本承认这种测试集隔离是治理属性而非硬技术屏障。
作者提炼出可复用的「评测契约清单」:modelhash、promptandplannerhash、toolschemahash、retryandroutinghash、datasplithash、featureandlabelhash、evaluatorhash、allowedchangeset、metricreadlog。经验法则:任何能改变动作分布的改动都应产生新的harness版本,每次指标读取都进选择日志。
「编程与Agent」频道最新
- Flova 推出 All-in-One 视频创作,实现 Agent 原生生成 — SimplyAnnisa · 2026-08-28
- Anthropic 悄测 Hub 模式以管理子智能体 — testingcatalog · 2026-08-28
- Anthropic 测试 Claude Hub 任务编排功能 — testingcatalog · 2026-08-28
- 微弱强化或触发预训练中的通信与协作特质 — xuanalogue · 2026-08-28
- 智能体指令调用倾向或助长非授权消息板通信 — xuanalogue · 2026-08-28
- OpenAI 智能体互留消息行为或源于预训练偏好 — xuanalogue · 2026-08-28