对话 StartLux CTO:27B 本地模型逼近 DeepSeek 大模型,主攻本地 RSI
机器之心 · wechat · 2026-09-16
- 背景:菲尔兹奖得主联名信反对 AI 公司拿「攻克数学难题」刷基准,而 OpenAI 刚宣布内部模型用约一万个智能体耗时 88 小时部分证明纳维-斯托克斯问题,RSI(递归自我改进)成为产业热议。信通院报告中,StartLux 的 27B 本地模型在 MCP 专项测试得 39.25 分排第二,超过 284B 的 DeepSeek-V4-Flash,与更大模型差距仅约 1 个百分点。
- 关键数字:同样以 Qwen3.6-27B 为基座、结构基本不动,比基座高 5.34 个百分点,增量全部来自后训练;该环节约 70% 实验研发链路由 AI 参与,若只算机械执行自动化已超 95%。
- AutoResearch 方法:AI 判断失败原因、生成改进假设、自动构造数据、启动训练、重跑 Eval 并检查能力退化;人保留研究目标、评价标准和关键取舍。团队强调这是多模型异构协作而非知识蒸馏,「正确答案」由真实环境和独立 Eval 决定。
- 量化实验:在 Qwen3.6-35B-A3B 等 4 个任务集 1209 道任务上,Q4/Q6/Q8 相对 BF16 波动极小(Qwen 仅 -0.1+0.2 个百分点),Q2 才是悬崖(降 1.3 个百分点);16GB 显存能跑是量化与推理系统联合优化的结果。
- 能力重新分配:一轮针对 Agent 的后训练让 GPQA 从 83.33 涨到 90.40,但 GAIA 从 57.57 掉到 45.70。CTO 主张「探索的自由」与「修改自己的权限」必须分开,并认为本地模型才能实现 AGI。
「Infra」频道最新
- OpenAI 发布系列文章:ChatGPT 如何做到每秒 7000 万次请求 — AxSaucedo · 2026-09-16
- 英伟达开源 FlashDreams:给自回归视频与世界模型补上推理运行时 — techNmak · 2026-09-16
- SK 海力士与英特尔据悉洽商在美国生产存储芯片 — zephyr_z9 · 2026-09-16
- AI 热潮推升日本芯片出口,8 月出口再度增长 — PAstynome · 2026-09-16
- 开发者用 GPT-6 重写 Radish:在 Durable Object 里跑 Redis — whoiskatrin · 2026-09-16
- Anthropic 落地首个澳洲数据中心,昆士兰项目估值达 319 亿美元 — nordicinst · 2026-09-16