两位律师 500 处合同修改仅 45% 一致,Crosby 揭秘法律 eval 构建
graceisford · x · 2026-10-08
AI 法律公司 Crosby 的创始工程师 Aveek Duttagupta 撰文详解公司如何为法律推理构建 eval。
背景
- Crosby 是一家自建律所的 AI 公司,目标是让 agent 完成尽可能多的法律工作,把数周的交付压缩到数小时,律师与工程师并肩开发 agent。
- 合同是切入点:量大、跨行业、有书面载体,看似有明确上下文(合同本身、客户立场、谈判历史、商业风险),但其中的权衡细微度远超文档本身。
核心难题:主观但可测
- 实验中两位资深律师对同一批 20 份 NDA 各自制作「理想」redline(golden set),500 处修改中仅 45% 一致——说明合同评审既可测量又深度主观。
- 与传统软件不同,没有编译器或单元测试能判定 AI 的修改是否是人类也会发出的,把不可验证问题转化为可规模化验证成为核心工程挑战。
文章为 agent eval 工程在非可验证领域的方法论提供了具体案例。
所属事件:Crosby 详解如何为法律推理构建评测体系(2 条相关)→
「编程与Agent」频道最新
- 开发者用 Obsidian v5 打造 AI 自动化 vault,五大手工事项全免了 — dSebastien · 2026-10-08
- Hashimoto 出品 Rex:为 AI 编码终端体验打造的分屏终端 — ricklamers · 2026-10-08
- DAIR.AI 整理 31 篇递归自我改进论文,从 Schmidhuber 到最新技术 — omarsar0 · 2026-10-08
- 「最烂代码都是人写的」:开发者反呛 AI 代码质量焦虑论 — DoctorJosh · 2026-10-08
- 转发「现代开发者应聚焦的技能」短视频,称建议具体实用 — rseroter · 2026-10-08
- 2026 年 AI 工程师修炼清单:从 Python 到上线一个真 Agent — nevrekaraishwa2 · 2026-10-08