DeepSeek多次尝试可追平Luna:pass@2成本仅$0.20
zainhas · x · 2026-08-07
zainhas指出,虽然Luna单次质量更高(67.2% vs 53.3%),但DeepSeek的经济性允许并行多次尝试:2次尝试达81.6% vs 70.1%,4次达90.3% vs 80.5%。在DeepSWE任务中,DeepSeek pass@2超过Luna pass@1,成本仅$0.20 vs $0.61。
所属事件:DeepSeek-V4 Flash vs GPT-5.6 Luna:性价比完胜,质量达八成(11 条相关)→
「编程与Agent」频道最新
- 异星工厂成 AGI 终极测试?FLE v0.3.0 发布 — jwt0625 · 2026-08-07
- 揭秘 Claude Science:超长上下文自动压缩与后台纠错机制 — josephdviviano · 2026-08-07
- AI 工程核心痛点:是模型本身不行,还是评测框架有问题? — zainhas · 2026-08-07
- Orbit:用本地 Markdown 管理多 AI Agent 协作 — khanhhuy_1998 · 2026-08-07
- Hermes Agent 结合 MCP 实现桌面端控制与自动化安卓手机 — Teknium · 2026-08-07
- Aeon:无需人工确认的全自主智能体框架 — tom_doerr · 2026-08-07