曝 V4 GA 评测流出:安全护栏大幅放宽,仍需强化学习突破
teortaxesTex · x · 2026-08-13
近日疑似 V4 GA(正式版)的评测分数曝光。据测试反馈,其整体能力略弱于 K3 模型,但在通常受限的领域表现出明显的“安全护栏放宽”趋势。
不过,分析指出 V4 与 0731 等前沿模型的差距表明,仅靠扩大参数规模已不足以实现代际跨越,厂商亟需在强化学习(RL)环境上取得新的实质性进展。
「模型」频道最新
- Grok 4.6 智能指数紧咬 Claude Fable 5,输入输出 token 价格便宜 5 至 8 倍 — rohanpaul_ai · 2026-08-13
- Grok 4.6 智能体评测逼近 Claude Fable 5,单次任务成本仅其五分之一 — ArtificialAnlys · 2026-08-13
- DeepSeek V4 Pro每任务成本比GLM5.2低10倍,比Opus4.8低72倍 — ojasvi_yadav · 2026-08-13
- DeepSeek V4 Pro 性价比曝光:单任务成本仅为 GLM5.2 十分之一 — ojasvi_yadav · 2026-08-13
- DeepSeek API 请求超时,疑似遭遇技术故障 — cedric_chee · 2026-08-13
- 免费版 ChatGPT 限流策略:思考按钮用多会被静默降级 — Sauers_ · 2026-08-13