网友称 CritPt 与 SciCode 评测均失效,AI2 可信度存疑
inductionheads · x · 2026-09-04
用户 teortaxesTex 在与 TheZvi 的讨论中称 CritPt 和 SciCode 两个评测基准都已失效,认为 AI2(在该维度)相对 Anthropic 存在真实知识与能力差距,核心结论是:在修好评测体系之前,其评测结果不可信。
「模型」频道最新
- OpenAI 新架构被指削弱思维链可监测性,安全圈警报拉响 — ShakeelHashim · 2026-09-04
- K2 Horizon 发布 6 款全开源模型,0.9B 到 375B 附全部训练代码与数据配方 — aliscodes · 2026-09-04
- 早期用户实测 GPT-6 Astra:8 分钟用 Blender 捏出狼人,17 分钟造出世界模拟器 — TheMoonMidas · 2026-09-04
- swyx 烧掉 200 亿 token 深测 Astra:训练模型、标注数据全包,成本低至每小时 6 美元 — charliermarsh · 2026-09-04
- OpenAI Kaiser:去年圣诞 Codex 突变连我们自己都说不清原因 — a_karvonen · 2026-09-04
- ARC-AGI 主办方:给模型套超强提示词,测的是人不是模型 — GregKamradt · 2026-09-04