游戏 PC 上跑 Claude 式代码智能体 8 个月:ATLAS 让小模型逼近前沿能力
itigges22 · reddit · 2026-09-18
作者记录了一个为期 8 个月的个人研究项目 ATLAS:不改动小模型权重,只改造模型周围的系统,尝试让消费级游戏 PC 上的本地小模型在特定任务(先从代码入手)逼近前沿模型水平。
核心思路:综合数百篇论文,围绕「生成多个候选 → 验证 → 用执行反馈修复」构建系统,强调模型自评不可信,必须真实执行检验。
V1(2026 年 1 月):
- llama.cpp 本地量化推理,支撑显存放不下的模型;
- RAG(embedding 服务 + Qdrant)检索代码块,弥补小上下文;
- 沙箱执行 + 重试,并按重试次数调温度促进输出多样性;
- Redis + workers + K3s 的任务队列与部署基础设施。
V2(2026 年 2 月):
- Best-of-K 候选生成,强调候选多样性与选择质量缺一不可;
- 「Geometric Lens」:用代码 embedding 和执行 pass/fail 标签训练的小神经网络,输出标量能量场 C(x) 用于评估候选(帖文在此截断)。
所属事件:ATLAS 项目:不改权重让小模型逼近前沿水平(2 条相关)→
「编程与Agent」频道最新
- 用户实测 Muse agent 10 分钟自动打电话约到牙医,成本近乎为零 — ChrisUniverse · 2026-09-18
- AI Agent「Jev」花 1.21 美元、8000 次决策,拿下宝可梦首枚道馆徽章 — HankYeomans · 2026-09-18
- LAX 发布:自然数学语言直连 Lean,可形式化复杂度类结果 — lpachter · 2026-09-18
- GitHub 官方 CLI 扩展 gh secure:一条命令开启公共仓库全部免费安全设置 — 0xkarasy · 2026-09-18
- GitLab 托管 Kimi K3、GLM 5.3 等开源模型:同等额度调用数提升 4 倍 — RealGeneKim · 2026-09-18
- 演示惊艳实战拉胯:用户吐槽编码 agent 后台任务连环翻车 — Particular-Swan2404 · 2026-09-18