开发者实测:CritPt 评分体系存在缺陷,未随推理增加
scaling01 · x · 2026-09-02
一位开发者指出 CritPt 评测基准存在明显缺陷,其评分缺乏逻辑且并未随着模型推理时间的增加而显著提升,暗示该基准可能无法准确反映推理模型的真实能力。
「模型」频道最新
- 开发者实测:Anthropic 5.1 是跨越式升级 — doodlestein · 2026-09-02
- Fable 5.1 测试翻车:效果未达预期 — Angaisb_ · 2026-09-02
- Claude Fable 5.1 强悍演示:一句话生成马里奥赛车游戏 — ezshine · 2026-09-02
- Gemini 3.7 Flash 展示智能体视频理解能力 — otarU · 2026-09-02
- OpenAI Astra 在 ExploitBench 漏洞利用测试中达 100% 成功率 — JiaweiLiu_ · 2026-09-02
- 实测 Claude Fable 5.1:Max 模式下的“鹈鹕骑行” SVG — Simon Willison · 2026-09-02