开源合成律所 C&H:专为评估 Agent 持续学习能力打造
mrdrozdov · x · 2026-08-10
现有 Agent 基准测试往往将模型丢进孤立任务中,缺乏对持续学习和记忆力的评估。为此,开发团队开源了一个名为 Calderwood & Harkness (C&H) 的合成律所环境。
C&H 模拟了真实的法律工作场景,要求 Agent 在同一底层背景下处理多项持续性任务。这旨在测试模型能否像资深工程师或律师那样,通过积累经验、构建心智地图来更高效地解决问题。
「编程与Agent」频道最新
- AI编程智能体重塑开发技能:从语法实现转向系统架构 — ingliguori · 2026-08-10
- WolfBench:重新定义智能体评测的五维指标 — morgymcg · 2026-08-10
- 开源长程智能体框架发布:支持跨会话记忆与沙盒 — Saboo_Shubham_ · 2026-08-10
- 构想智能体“八卦协议”:打通人与 AI 的统一通信层 — pzakin · 2026-08-10
- 开发者工具演进:从按需生成走向结构化对话仪表盘 — BLUECOW009 · 2026-08-10
- 动手算账:五道智能体 API 调用成本计算题 — ProfTomYeh · 2026-08-10