梳理 47.6 万字模型卡,Free Systems 做 28 张前沿模型对比卡曝光证据缺口
soumitrashukla9 · x · 2026-09-11
- Free Systems Lab 发布新研究:人工从头构建了 28 张前沿 AI 模型卡,基于约 47.6 万字的模型/系统卡材料,做成可浏览、检查、横向对比的 Model Cards explorer(含 trading card 式界面)。
- 核心发现:各家实验室公开发布的证据之间很难对齐比较,安全与能力证据的报告口径存在大量缺口。
- 卡片覆盖 OpenAI、Anthropic、Google DeepMind、Meta、Mistral、xAI、Thinking Machines、Moonshot AI、DeepSeek 等,每张卡浓缩关键基准成绩(如 ARC-AGI、FrontierMath、Terminal-Bench)与强弱项。相关同帖另有 ahallresearch 的说明:目标是把模型卡压到「不大于一张宝可梦卡」的大小,属早期工作并征求反馈。
「模型」频道最新
- 网传 DeepSeek v4.1 Flash 曝光,真实性待确认 — petrusenko_max · 2026-09-11
- Persimmon 团队亮相:数月研究成果开放研究预览申请 — niloofar_mire · 2026-09-11
- 付费用户吐槽:Astra 更聪明但额度消耗远超 Google 方案 — MickeySteamboat · 2026-09-11
- GPT Astra 实操 Dominions 6,挑战硬核 4X 策略游戏 — garden_frog · 2026-09-11
- Benchwarmer 工具上线:自动纠正误导性 AI 评测图表,重算胜者 — aronchick · 2026-09-11
- GPT-6 Astra 自主操控无人机穿越办公室追踪特定人类 — TheMoonMidas · 2026-09-11