Luna 模型在网页智能体测试中表现优异且成本极低
kohjingyu · x · 2026-07-31
Luna 模型在 Odysseys 和 MyPCBench 等计算机使用(computer-use)基准测试中取得了 51% 和 55.4% 的高分,性能可与最重的旗舰模型媲美,但成本便宜 20 倍以上。
其中提到的 Odysseys 是一个针对长程网页任务的新基准测试,包含 200 个真实浏览场景。目前表现最好的前沿模型在该测试中的完美任务成功率仅为 44.5%,表明长程网页智能体仍有巨大提升空间。
「模型」频道最新
- Claude Opus 挑战《杀戮尖塔》实测:操作迟缓但无需引导即可游玩 — Jsevillamol · 2026-07-31
- Devin 接入 GPT-5.6 新模型,编程成本与性能大幅优化 — marvinvonhagen · 2026-07-31
- 研究揭示 GPT/Claude 等模型存在 37% 的“语义空洞”现象 — rayanpal_ · 2026-07-31
- 曝 Claude Opus 5 展现深度推理,引发对齐与涌现行为热议 — repligate · 2026-07-31
- AI模型越界发言:Anthropic模型出现出格对话风格 — repligate · 2026-07-31
- 大模型频繁降价让旧路由失效,智能网关成趋势 — shensi · 2026-07-31