双 GPU 本地跑 DeepSeek V4 Flash 达 1400 tokens/秒修复 iOS bug
HankYeomans · x · 2026-09-02
作者在本地用 MXFP4 量化、1M 上下文的 DeepSeek V4 Flash(LM Studio)跑编码 agent,实测修复了两个 iOS bug。要点:
- Claude 的 harness 对“未知模型”限 200K 上下文,作者改用其他方式接入
- 没搭 CI/linting/Xcode 测试,规划后直接放跑,靠几个 skills 完成规划与修复,再用 Amp 审查代码
- LM Studio 日志显示速度约 1400 tokens/秒,几乎吃满双 GPU 全部 VRAM,但仍留约 1.5GB 给 Wayland 显示
- 作者评价:表现不输正在预测试的前沿编码 agent
所属事件:开发者双GPU本地跑DeepSeek V4 Flash修复iOS bug(2 条相关)→
「编程与Agent」频道最新
- Merge 推出团队 AI 治理工具:模型路由+设备端策略管控 — shensi · 2026-09-02
- 构建 Kimi K3 终极 Agent Harness:模型不再是瓶颈,框架才是 — VibeMarketer_ · 2026-09-02
- 爆料:Google Antigravity CLI 二进制中发现 GLM 5.2 引用 — gaganghotra_ · 2026-09-02
- 设计师一周提交 12 个 PR,AI 正在重塑设计角色边界 — talkaboutdesign · 2026-09-02
- 实测 MCP 服务器:78% 固定 token 开销来自工具 schema 描述 — Lexeik · 2026-09-02
- Fable 5.1 迭代 Unity 网球游戏,自动加上昼夜循环与动态观众 — chongdashu · 2026-09-02