微软员工:模型能力仅占性能 40%,Harness 决定 60%
RihardJarc · x · 2026-08-31
一位微软 AI 员工分享了对模型与工程实践的比较与行业看法:
- 模型特性对比:Claude 适合复杂的多步推理任务,重做需求较少;OpenAI 适合单步执行,但复杂任务因反复修正成本高出 20-30%。
- 实战表现:Claude Code 的原生配对首遍通过率比 GitHub Copilot 高 20-30%,但预计 Copilot 会通过改进集成缩小差距。
- 关键观点:模型正成为商品,60% 的性能取决于“Harness”(工程框架/集成层),仅 40% 取决于模型本身。
- 定价趋势:出于成本可预测性,行业将从按 Token 计费转向按结果付费。
- 人才需求:初级开发招聘减少,未来 3-5 年 65-70% 开发周期将自动化,具备判断力和 Agent 技能的经验者更值钱。
「编程与Agent」频道最新
- 开源 CommerceAgentBench,Qwen 跃居开源模型榜首 — Alibaba_Qwen · 2026-09-01
- 实测发现:Agent 查“此人是谁”几乎全死路 — Dry_Steak30 · 2026-09-01
- 整合 Posthog 与 Notion,Agent 自动化用户访谈与反馈闭环 — lennysan · 2026-09-01
- 用 Grok Bot 构建大学录取数据集清洗流 — lennysan · 2026-09-01
- 构想 Grok Bot 钱款漏洞猎人应用 — lennysan · 2026-09-01
- 从 Discord 机器人到多人共享 Agent 工作区:团队工作流升级记 — steipete · 2026-09-01