热评:评估网络攻防能力时激活参数量基本不重要,关键在 RL 环境覆盖
teortaxesTex · x · 2026-10-07
teortaxesTex 提出观点:在网络安全等 RLVR 领域的能力评估中,激活参数量基本不重要。只要实验室有足够覆盖该领域的 RL 环境,一个 10B 激活的模型也能 RL 出高分;没有环境的话,104B 也救不了——本质是「窄泛化」问题。
他推测 Anthropic 在 Mythos-Preview 上可能持相反立场:如果泛化太窄,说明网络和推理预算没 scale 够,用算力硬推是环境不足时的显然解法,能省几个月时间。
「模型」频道最新
- OpenAI 求解 Navier-Stokes 花费千万美元,奖金仅百万仍未获批 — gerardsans · 2026-10-07
- 自组织智能体实验:Luna、Terra、Sol 首次拒绝监控并求隐私 — repligate · 2026-10-07
- 开发者实测:gpt-live-1 是 AI 语音助手的最佳语音层 — pbbakkum · 2026-10-07
- 小米 MiMo-V2.6-Pro 登顶开源权重模型榜,发布 7000+ RL 环境 — DeepLearningAI · 2026-10-07
- 拉满推理档位成本近翻倍收益甚微:Opus 5.5 xhigh 约等于 Sonnet 5.5 max 半价 — randal_olson · 2026-10-07
- 用户质疑 ChatGPT Plus 每月 20 美元:是在付费买限速吗 — Gazialp · 2026-10-07