AI 市场需要独立记分员,模型评测成新商机
JenniferHli · x · 2026-08-14
作者认为,随着 AI 模型被广泛应用于金融、法律、软件开发等复杂工作流,传统的标准化基准测试(如 SATs、LSATs)已无法证明模型在真实世界中的能力与安全性。我们需要“上路驾驶测试”。
然而,构建针对真实专家工作流的评测系统、自动进行专家级打分并跟上前沿模型的发布节奏,在技术上非常困难。正如信贷和公开市场需要独立的评级和审计机构,AI 市场同样需要一个独立的“记分员”。这正是 Vals 试图填补的市场空白:为企业提供可信赖的模型能力指南。
「公司和人」频道最新
- Meta办「Vibecoding」游戏开发赛,总奖金池达 30 万美元 — arnicas · 2026-08-14
- 调侃大模型发布套路:从最强到开源,再到去中心化 — markjeffrey · 2026-08-14
- ChatGPT 测试广告引争议:AI 推荐的客观性边界在哪? — Extreme-West4844 · 2026-08-14
- 推文盘点中国开源大模型版图:各路豪杰分兵突击 — teortaxesTex · 2026-08-14
- OpenAI 揭秘板球队如何用 ChatGPT 制定比赛与拍卖策略 — OpenAI · 2026-08-14
- 马斯克盯上 AI 编程赛道,关注 Cognition 官方账号 — AccBalanced · 2026-08-14