V4.1 推理能力曲线非线性,Agent 团队模式用 RL 显式训练协作
nrehiew_ · x · 2026-09-11
nrehiew 继续 V4.1 技术报告解读:
- 推理性能曲线并非完全线性,原因存疑;他指出 FrontierCode 曾有代码质量惩罚项影响 Opus 5 xhigh,但这三个基准似乎没有类似惩罚
- Agent swarm 图表更平滑;报告称 Agent 团队模式用 RL 显式训练,奖励函数结合任务表现、鼓励委派与智能体间通信的「协作奖励」,以及促进高效协调的延迟惩罚
所属事件:DeepSeek V4.1 技术报告解读:RL 基建、沙箱与推理栈细节曝光(8 条相关)→
「模型」频道最新
- ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18% — ysu_nlp · 2026-09-11
- CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成 — jyangballin · 2026-09-11
- 稀疏注意力可做多层级:DeepSeek V3.2 思路与搜索排序系统同构 — nptacek · 2026-09-11
- muse spark 1.3 在 CursorBench 4 上表现强且便宜 — infoxiao · 2026-09-11
- 用户盼 Haiku 3.5 回归:旧模型可被永久切断引不满 — repligate · 2026-09-11
- kalomaze:fable 5 部分问题出在后训练没做熟 — kalomaze · 2026-09-11