从业者对谈提炼 Agent 实践三条:评测对齐客户结果、少护栏、垂直微调
illscience · x · 2026-09-11
作者 illscience 在 Connected Stack 活动上与同行交流,概括了三条 agent 实践观点:
- 最好的评测(evals)应直接对齐客户结果,而非代理指标;
- Agent 需要犯错的机会才能发挥最佳水平,过度护栏反而有害;
- 在垂直市场用定制模型能创造超额表现。
属于经验性观点分享,有一定实践参考价值但无展开细节。
「编程与Agent」频道最新
- Pydantic AI 演示自建编码 harness:搭配 Codex 子智能体 — samuelcolvin · 2026-09-11
- Google Cloud 推出 agent 插件:MCP 实时文档加 100+ 按需加载技能 — rseroter · 2026-09-11
- GUI 或是史上最意外的 AI API:浏览器使用为何特别适合 AI — signulll · 2026-09-11
- MCP 之争:Clerk 工程师痛斥浪费,Sentry 创始人反驳自己已省下大量时间 — zeeg · 2026-09-11
- Reddit 用户吐槽新模型啰嗦难用:十分钟自说自话还不按需求写码 — snoosnoosewsew · 2026-09-11
- Donorbox 把 MCP server 做成付费服务,让 agent 替你捐款 — jeff_weinstein · 2026-09-11