Hex 平台推出原生 LLM 评测工具,支持模型批量对比
Madisonkanna · x · 2026-08-06
数据分析平台 Hex 官方宣布在其产品中正式推出了 Evals 评测功能。该功能基于团队过去两年自建内部评测工具的经验积累,旨在帮助开发者更好地测试知识库智能体。
主要功能亮点包括:
- LLM 裁判机制:支持基于具体规则的细粒度打分。
- 模型批量扫描:方便开发者针对不断推出的新模型进行横向效果测试。
- 代码定义一切:所有评测流程完全代码化,不仅支持使用 Agent 进行快速设置,还能将变更纳入 Git 进行版本控制。
「编程与Agent」频道最新
- Arkham 支持 x402 标准,AI 智能体可自主用 USDC 支付 — kleffew94 · 2026-08-06
- 智能体工程避坑:盲目使用小模型降本或致延迟增加 — brandon_galang · 2026-08-06
- Codex Remote提供无缝云端开发体验,比手动SSH更便捷 — djcows · 2026-08-06
- DeepSeek 试错加 Opus 兜底:开发者分享 AI 编程模型组合技 — gandamu_ml · 2026-08-06
- LLM 0.32 发布:支持推理追踪与 Anthropic 服务端 MCP — JeremyCMorgan · 2026-08-06
- 开发者展示智能体可视化交互:拒绝终端长文 — MarcJSchmidt · 2026-08-06