Supabase 开源 Evals 真实测评 AI 智能体

大模型之路 · wechat · 2026-08-17

现有的 AI 编程评测多基于合成题,无法反映真实后端开发中的安全与合规风险。Supabase 开源的 Evals 工具旨在解决这一问题,它将真实的客户工单、Bug 报告转化为考题,涵盖 Schema 设计、RLS 策略修复、数据库迁移等实际任务。

评测机制采用确定性检查(如验证权限访问)与 LLM 裁判评分结合,允许重试并支持回归测试。初步数据显示,模型工具使用能力比模型规模本身更重要;不同智能体在文档阅读习惯、代码风格上也存在显著差异。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →