ProximalHQ 训练 Qwen3.8-27B,DeepSWE Pass@1 提升至 37.2%
aryaman2020 · x · 2026-10-09
ProximalHQ 展示用其数据验证/训练方案在内部编码任务集上训练 Qwen3.8-27B:DeepSWE 基准 Pass@1 达到 37.2%,比基座模型高 8.4 个百分点;Pass@8 从 67.7% 升至 86.6%。转发者称这是验证数据的好方法。
「编程与Agent」频道最新
- 用 Temporal 让 Pi 编码智能体跨机器故障存活 — francesc · 2026-10-09
- Zed CEO:AI 生成的单元测试多是 slop,集成测试才是正解 — zeeg · 2026-10-09
- 号称最快 Agent 模型 Jev:毫秒级决策近零成本,10 个用例详解 — Arindam_1729 · 2026-10-09
- LLM 该不该写测试?开发者:测试暴露内存装不下的问题,值得写 — ivan_bezdomny · 2026-10-09
- 马斯克晒 Grok 一句话装好 16 个游戏模拟器 — elonmusk · 2026-10-09
- 开源 MCP 客户端 MCPtoAI:跨模型共享工具且凭据不出本地设备 — abktya · 2026-10-09