争议:未在私有基准测试不应宣称满分

JFPuget · x · 2026-08-31

JFPuget 回应了关于其模型在 ARC 基准上得分的质疑,强调他们仅在公开评估游戏上测试,并指出缺乏支持半私有数据评估的工具是导致无法提交社区排行榜的原因。François Chollet 则反驳称,如果模型从未在私有基准上评估,就不应宣称在该基准上得分 100%,并批评了未开源解决方案的做法。

所属事件:Chollet 回应 ARC-AGI 评测争议:未跑分勿称满分(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →