Da7em Bench 发布:每模型 200 个真实客户任务、12 领域评 AI 实战力
airesearch12 · x · 2026-09-20
一个自称全球首个基于真实客户工作的独立模型基准 Da7em Bench 发布。
- 每个模型在推理、研究、规划、交付、坚持性、准确性、诚实度、工程、品味、写作、沟通等 12 个领域各跑约 200 个真实任务
- 每个模型在多套 harness(官方与中立的 Droid、Hermes Agent、Devin、Cursor)下测试,避免单一 harness 决定结果
- 1-5 分制:5 分表示交付即被接受,中间分需返工,1 分为失败;标准是对比付费专业人士的交付水平
- 任务保密以防泄漏进训练数据抬升后续分数
「编程与Agent」频道最新
- AI 全程操刀设计 4 层 PCB:135 个元件 514 个焊盘,人几乎没动手 — Paimaamu · 2026-09-20
- 程序员金句:被淘汰的不是开发者,而是不会用开发者的 AI — ashishllm · 2026-09-20
- Agent 产品 NoSpoon 月底转私有,作者称消费级创意市场为时尚早 — Kyrannio · 2026-09-20
- 用 Codex 做室内挂画排版:Blender 里 3D 重建免重算锚点 — perilli · 2026-09-20
- AI 工程师日常都在干什么?RAG、可观测性与后端初探 — tech_kie · 2026-09-20
- 一条 Queue 生成整部广播剧:开源本地多模型流水线发布 — fflluuxxuuss · 2026-09-20