千禧年难题当基准可能要 100 年才饱和,但前沿模型已擅长反证猜想
evijit · x · 2026-09-09
OfirPress 在谈基准构建时曾举例:千禧年大奖难题可以当基准,但太难,可能要 100 年才能饱和——现在看来一语成谶。evijit 回应指出要看具体指标:前沿模型在寻找反例、证伪猜想方面已相当强,但在给出闭式解(closed form)上还差得远,闭式解类成果的饱和可能需要更久。
所属事件:基准专家曾称千禧年难题当基准需百年饱和,如今感叹说得太保守(3 条相关)→
「模型」频道最新
- 爆料称有整条产业暗中包装用户工作身份卖给大模型厂商 — kevinafischer · 2026-09-09
- 社区发布 27B 无审查微调模型,用 Marchenko-Pastur 蒸馏训练噪声 — EvilEnginer · 2026-09-09
- Astra 玩宝可梦对战自主学赢一局,单场烧掉 25 美元额度 — bucketbot91 · 2026-09-09
- Reddit 用户吐槽 Claude 用量百分比不透明:应像云厂商按计量单位计费 — NTXL · 2026-09-09
- Thomson Reuters 基于 Qwen 自训 397B 法律大模型,合规场景胜 GPT-5.4 — DeepLearningAI · 2026-09-09
- 浏览器里跑 27B 1-bit 模型:6GB 3060 笔记本达 25-30 tok/s — mentria-ai · 2026-09-09