Gemini 4 Argon 登顶深软件工程榜单,却仍锁在"可信测试者"手里
weswinder · x · 2026-10-10
爆料称 Google 的 Gemini 4 Argon 在 deepswe 和 automationbench 两个榜单登顶,成绩分别为 77.9% 和 51.3%。
但该模型目前仍仅对 Google 的"trusted testers"开放。作者同时观察:他认识的人里没有一个因为 Antigravity 而离开 Claude Code 或 Codex,并放话"榜单根本不重要,赶紧发货"。
信息点:新模型实力可期但仍未公开可用;编码工具市场的真实格局与榜单成绩存在明显脱节。
「编程与Agent」频道最新
- 独立开发者用 ThreeJS 造浏览器版 GT 赛车模拟,悬架按 IMSA 规则调校 — AIandDesign · 2026-10-10
- 多智能体系统 105 小时自动调优,Qwen3.5 推理提速 175 倍超 SGLang — bariskasikci · 2026-10-10
- Seroter 每日阅读:为 Agent 重构 API 设计与 LLM 评测信任 — rseroter · 2026-10-10
- Steve Yegge:Claude 会直接反编译闭源工具二进制摸清原理 — Steve_Yegge · 2026-10-10
- YC 办「用户是 Agent」主题黑客松,Supabase 赞助 10 月开赛 — ycombinator · 2026-10-10
- 跑几天不死的 agent 怎么养:心跳板、epoch 围栏与九条实践 — milkygirl21 · 2026-10-10