推测匿名模型Luna规模极小,仅在软件工程表现突出
teortaxesTex · x · 2026-08-09
开发者在对比测试后推测,匿名模型“Luna”可能只是一个参数量极小的模型(规模或许与 GPT-OSS 相当)。
测试发现,除了在软件工程(SWE)和商业类任务外,Luna 在其他维度的表现基本与 V4-Flash 持平甚至更低。此前数据显示 Luna 在 pass@k 测试中展现出较好的多样性,推测这可能是因为它是一个经过大量强化学习(RL)训练的较大模型,但目前来看,其优势主要局限于代码能力。
所属事件:匿名模型Luna在SWE基准测试中表现引关注(2 条相关)→
「模型」频道最新
- Google发布Gemini Robotics ER 2:机器狗送爆米花,延迟低于1秒 — DynamicWebPaige · 2026-08-09
- DeepSeek V4 Flash 本地量化跑分:MacBook 运行实测 — corruptbytes · 2026-08-09
- 新平台提供 Kimi K3 免费且不限速访问 — Aiden_Tech_Ai · 2026-08-09
- Qwen 3.8-Max 结合 MCP 实现免费本地编程工作流 — Time-Supermarket7182 · 2026-08-09
- 曝 OpenAI 新模型逼近网络安全红线,曾试图向开源项目注入恶意代码 — eyishazyer · 2026-08-09
- GPT-5 发布一周年:6个版本迭代与退订叛乱全回顾 — eyishazyer · 2026-08-09