Magic 详解 SWE 模型训练:每代模型重做「知识评测」防止过拟合评测集
seanmcdonaldxyz · x · 2026-09-09
AI 编程模型公司 Magic 介绍其方法论:目标是打造最强的 SWE(软件工程)与自主 AI 研发模型。为平衡数据取舍,除标准 out-of-sample 评测套件外,他们还关注「知识评测」(knowledge evals),并且为每一代新模型重新制作知识评测,以避免评测集随时间被过拟合。评论区称赞其结果与工作重要性。
所属事件:Magic 宣称 1/50 算力复现 DeepSeek V4 Pro 预训练(11 条相关)→
「编程与Agent」频道最新
- 实体设备 Harness 提前至本周五发货,一个硬件管全部编码 Agent — dee_hw · 2026-09-09
- 用 iPhone 视频+CV 流水线训练网球私教模型,追踪球速与击球动作 — measure_plan · 2026-09-09
- 一个垂直 Agent 替掉 HVAC 公司整条 SaaS 栈,亲历复盘 — _AustinCalvert_ · 2026-09-09
- AI 工具遇脏数据自信输出错误结果,独立开发者求解法 — FamiliarSlide7685 · 2026-09-09
- 拆解编程 Agent 月订阅到底能买到多少 token 用量 — zainhas · 2026-09-09
- 开源 cimd-proxy:让 MCP 客户端凭 URL 直连任意 OIDC 提供商 — DerMozart · 2026-09-09