Artificial Analysis 推出 Optima:自定义 benchmark 评测 GPT-6 Astra
ArtificialAnlys · x · 2026-09-10
Artificial Analysis 上线 Optima,让用户用自己的任务和数据搭建自定义 benchmark,评测包括 GPT-6 Astra 在内的最新模型。
- 三步流程:描述工作并附示例(或导入轨迹、用 coding agent),Optima 的构建 agent 自动起草任务和评分 rubric;选择评测类型(Q&A、文档问答、Agentic 任务、对话模拟等);运行并打分。
- 每个结果同时给出性能、成本和耗时对比,官方称比标准榜单更贴合具体用例,成本时间可降 10 倍以上。
- 打分可用自定义 rubric,或调用其主流评测的评委模型 panel 做模型对决。
这对需要为特定场景选型的团队是实用工具,也意味着新模型发布当天就能跑自己的评测。
「研究」频道最新
- UCLA发布VDiff-Bench:多模态模型细粒度图像差异识别集体翻车 — UCLA · 2026-09-10
- 新基准 VDiff-Bench:1756 题暴露前沿模型找不同能力短板 — yixin_wan_ · 2026-09-10
- Michael Levin 新论文:以结构化潜空间刻画新形态的生命与心智 — danfaggella · 2026-09-10
- 研究显示「末日论者预测更准」或只是流言:XPT 锦标赛复盘 — random_walker · 2026-09-10
- AI 安全前沿正从神经网络转向智能体网络的可解释性 — Hidenori8Tanaka · 2026-09-10
- AI 影像+基因组学发现心脏-脾脏轴关联 — EricTopol · 2026-09-10