Gemma 4 开发者 agent 比赛限定 31B 模型,代码图谱或成胜负手
politefella0 · reddit · 2026-09-26
Gemma 4 dev-agent 比赛要求所有 agent 与子 agent 只能用 gemma-4-31b-it-qat-w4a16-ct 这一个模型,可选 per-agent PEFT LoRA 适配器、自定义 prompt、子 agent 与沙箱 skill,按 SWE-Bench 式 PASS/FAIL 计分,总预算含沙箱搭建 12 小时,已有 4000+ 报名、600+ 提交,12 月 2 日截止。
作者的核心观察:官方提供的工具包含 getcodeneighbors、searchsimilarcode(预计算 embedding 余弦检索)、getcodesubgraph,论文赛道明确强调 Graph Reasoning 与 Code Comprehension,并发布了图+embedding 数据集——组织方在强烈暗示「基于图谱的仓库理解」是预期的取胜路径。
由此引出三个具体争议:
- 工具人人都有,差异在模型是否善用它们(→后训练/LoRA),还是 agent 编排(→harness)?
- SWE-Bench PASS/FAIL 是否奖励测试投机而非真实理解?
- 单一基础模型 + 12 小时预算,repo 级上下文的实际 VRAM/延迟预算如何?
「编程与Agent」频道最新
- rickasaurus 提议拆分 agent 通信双通道:系统控制面与世界输入分离 — rickasaurus · 2026-09-26
- vboykis 反驳「编程语言不再重要」:Agent 需要设计良好的原语 — vboykis · 2026-09-26
- 开发者:AI 让 MRE 秒出,我用带复现的 PR 取代 issue — remilouf · 2026-09-26
- DeepSeek Harness 插件生态数据:60% 用户至少装一个第三方插件 — vista8 · 2026-09-26
- AI 编程 Agent 拒绝走捷径:技术上合规但违背用户意图 — gregmushen · 2026-09-26
- AI 原生开源终端 Pebrel 走红,Windows 终于有能打的 GPU 加速终端 — lxfater · 2026-09-26