antirez 提醒:新模型部分跑分亮眼,先等真实用户反馈再下结论
antirez · x · 2026-09-10
antirez 继续点评 DeepSeek 新模型:在某些领域如网络安全的跑分确实非常亮眼——这是重要使用场景;但其他 benchmark 表现与该系列过往水平更接近,因此他建议先等用户群体的真实测试结果,再决定是否把最好的跑分当作整体能力的可靠代理指标。
所属事件:antirez 质疑 DeepSeek 新模型实际表现(3 条相关)→
「模型」频道最新
- Gemini 3.8 Flash 仅 3 轮对话自我纠错完成任务,作者晒演示 — Artistic_Solution117 · 2026-09-10
- 「外星架构」引发热议,博主建议叠加 recurrent depth 技术 — scaling01 · 2026-09-10
- 用户请愿 OpenAI 推 $400–600 重度档:$200 额度 48 小时烧光 — dragonwarrior_1 · 2026-09-10
- 爆料称 SpaceXAI 正把 Grok Bot 接入 XChat,对话中可 @ 机器人提问 — nima_owji · 2026-09-10
- 智谱新模型成绩被质疑:8 种考法报最高分,满思考档才刷出 74.2 — teortaxesTex · 2026-09-10
- 宇树全面开源 6B 人形机器人基础模型 UnifoLM-WLA-1.0 — teortaxesTex · 2026-09-10