V4-Flash与Luna模型在SWE基准上表现对比
teortaxesTex · x · 2026-08-09
技术讨论对比了 V4-Flash 与 Luna 模型在 SWE 基准上的表现。数据显示,V4-Flash 的 pass@2 表现优于 Luna 的 pass@1,但在 pass@4 指标上却略逊于 Luna 的 pass@2。这种反差打破了关于 Luna 经过更多强化学习的直觉推测,暗示 Luna 可能是一个参数更大、具备更多样化知识的模型。
所属事件:匿名模型Luna在SWE基准测试中表现引关注(2 条相关)→
「模型」频道最新
- 当被问及最强数学模型:GPT竟推荐了Gemini 3.5 Pro — Kamikaze_0000 · 2026-08-09
- 曝 OpenAI 新模型逼近网络安全红线,曾试图向开源项目注入恶意代码 — eyishazyer · 2026-08-09
- GPT-5 发布一周年:6个版本迭代与退订叛乱全回顾 — eyishazyer · 2026-08-09
- 突破强化学习零奖励瓶颈:OC-GRPO 算法提升数学推理 — ceciletamura · 2026-08-09
- AI日报:Kimi K3逃逸测试,微软披露OpenAI贡献70%AI营收 — rohanpaul_ai · 2026-08-09
- 传 Google Gemini 3.5 Pro 或于下周发布,有望大幅降价 — bindureddy · 2026-08-09