DeepSeek V4F-0731 在 EQ-Bench v4 成绩平平,高强度 RL 或损伤模型个性?
xeophon · x · 2026-08-01
TNG 科技对 DeepSeek 的 V4F-0731 模型在最新的 EQ-Bench v4 基准测试中的表现进行了测算,发现其成绩仅处于中等水平。
这引发了关于模型训练方法的探讨:高强度强化学习(RL)是否会对模型的「个性」产生负面影响?这种过度对齐或训练可能会在特定维度的测试中削弱模型原本的表现力。
「模型」频道最新
- 曝 OpenAI 新模型家族命名 Astra,主打多智能体协同 — basedjensen · 2026-08-01
- 曝 OpenAI 下一代模型 Astra:多智能体攻克科学难题 — daniel_mac8 · 2026-08-01
- DeepSeek V4-Flash 悄然升级,Terminal-Bench 暴涨 25.8 分 — alejandroll10 · 2026-08-01
- OpenAI 频繁降价发布与数学突破,被指预示能力起飞 — basedjensen · 2026-08-01
- AI模型Fable尝试为自发现的数学定律提供证明 — repligate · 2026-08-01
- Claude Pro 遭遇严重 Bug:无痕模式未发消息已显示额度耗尽 — Worldly-Topic5179 · 2026-08-01