Luna 模型在网页智能体测试中表现优异且成本极低

kohjingyu · x · 2026-07-31

Luna 模型在 Odysseys 和 MyPCBench 等计算机使用(computer-use)基准测试中取得了 51% 和 55.4% 的高分,性能可与最重的旗舰模型媲美,但成本便宜 20 倍以上。

其中提到的 Odysseys 是一个针对长程网页任务的新基准测试,包含 200 个真实浏览场景。目前表现最好的前沿模型在该测试中的完美任务成功率仅为 44.5%,表明长程网页智能体仍有巨大提升空间。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →