SciCode 基准被指过时:>90% 通过率已难反映前沿
geoffwolfe · x · 2026-10-08
anshuman1 指出 SciCode-verified 基准需要更新:当前模型 >90% 的通过率看似不错,但题目已经过时,部分甚至以某种形式出现在训练数据中。他预告 ReasonCoreAI 将推出更新、更难的科学问题并对本周新发布模型做基准评测,目标是构建尽可能无误差的评测集以推动真实前沿进展,欢迎 DM 参与。该讨论出现在对 Mistral 新开源模型成绩的祝贺语境下。
「模型」频道最新
- ThePrimeagen 实测 OpenAI 新决策模型:更快更准 — prd_008 · 2026-10-08
- Social Capital:前沿实验室约 90% 算力已转向后训练与推理 — soumitrashukla9 · 2026-10-08
- AI2 Bolmo 分词器消除全球南方文字的「token 税」 — Kyle_L_Wiggers · 2026-10-08
- Grok 机器人上线主动式功能,可主动建议你下一步做什么 — Daniel_Farinax · 2026-10-08
- OpenAI 与 Cloudflare 推出决策 API,355 道决策实测不敌 TypeSafe 的 Jev — PawelHuryn · 2026-10-08
- Gary Marcus 炮轰 OpenAI 数学突破报告:换未发布模型、零细节,过不了同行评审 — Gary Marcus · 2026-10-08