基准测试饱和后,厂商或转向技能提升
andrewaltair · reddit · 2026-08-20
用户发布一张基准测试图表,并评论认为当各项指标都达到 100% 时,公司将开始专注于提升模型的新技能。
「模型」频道最新
- Dots Studio 开源递归自我改进模型,主打自我批评机制 — omarsar0 · 2026-08-20
- dots3-note 展示环境交互、假设验证与记忆更新能力 — omarsar0 · 2026-08-20
- dots3-note Preview 展示未知环境适应与自迭代能力 — omarsar0 · 2026-08-20
- dots3-note 模型发布:280B 参数与自评估任务进展能力 — omarsar0 · 2026-08-20
- 彭博让七大AI代理比拼vibe coding,测中美谁领先 — pstAsiatech · 2026-08-20
- Frontier Radar:中国模型已追赶,西方 AI 优势还剩多少? — The Decoder · 2026-08-20