Supabase 开源 Evals 真实测评 AI 智能体
大模型之路 · wechat · 2026-08-17
现有的 AI 编程评测多基于合成题,无法反映真实后端开发中的安全与合规风险。Supabase 开源的 Evals 工具旨在解决这一问题,它将真实的客户工单、Bug 报告转化为考题,涵盖 Schema 设计、RLS 策略修复、数据库迁移等实际任务。
评测机制采用确定性检查(如验证权限访问)与 LLM 裁判评分结合,允许重试并支持回归测试。初步数据显示,模型工具使用能力比模型规模本身更重要;不同智能体在文档阅读习惯、代码风格上也存在显著差异。
「编程与Agent」频道最新
- Hermes-Agent 上线 90 万上下文,订阅用户可用 — alexcovo_eth · 2026-08-17
- Hermes 成 AI Agent 高杠杆玩法:900K 上下文,每周更新 — EXM7777 · 2026-08-17
- Benchwarmer 工具:矫正误导性基准测试图表 — MeganRisdal · 2026-08-17
- Agent 阅读上下文修复代码,不惧命名混乱 — dotey · 2026-08-17
- Codex 远程连接实现手机操控 PC 编程 — eigenron · 2026-08-17
- 发布 Custodian Labs:一站式构建与部署 LLM 智能体的 Python SDK — Custodian-Labs · 2026-08-17