争议:未在私有基准测试不应宣称满分
JFPuget · x · 2026-08-31
JFPuget 回应了关于其模型在 ARC 基准上得分的质疑,强调他们仅在公开评估游戏上测试,并指出缺乏支持半私有数据评估的工具是导致无法提交社区排行榜的原因。François Chollet 则反驳称,如果模型从未在私有基准上评估,就不应宣称在该基准上得分 100%,并批评了未开源解决方案的做法。
所属事件:Chollet 回应 ARC-AGI 评测争议:未跑分勿称满分(4 条相关)→
「模型」频道最新
- 内部人士:第三方模型评测中断,因算力被回收改跑他评 — sjgadler · 2026-08-31
- 开发者弃用 Opus 5 转投 Codex,称后者更优 — sirbayes · 2026-08-31
- Dots3-Note 权重开源:旨在解决基准与现实差距 — CodeByPoonam · 2026-08-31
- Tiel-Coder-35B-A3B 登榜 HF,引入投机解码与 MTP 技术 — peculiar-ragdoll · 2026-08-31
- Google 发布 Gemini Omni 1.1 Flash,快速多模态模型面向开发者更新 — thione · 2026-08-31
- DeepSeek 发布低价视觉模型,Anthropic 推 Agent 硬件控制协议 — thione · 2026-08-31