ML工程师通病:只看外部榜单,不懂产品该测什么
yunta_tsai · x · 2026-09-17
一位从业者指出机器学习工程的常见陷阱:过度依赖外部基准来评判产品好坏,却不理解产品本身的评价标准。好的评测应当捕捉真实的用户体验;如果训模型的工程师写不出这样一个自定义评测,说明他对要解决的问题理解或投入不够深。核心观点是:eval 要贴着产品体验设计,而不是套用公开榜单。
「编程与Agent」频道最新
- Lightfield 创始人:砍掉 200 万月活产品,重造 AI CRM — SethGRosenberg · 2026-09-17
- Claude Code 嫌功能太简单拒绝代写:让用户「自己动手实现」 — bendee983 · 2026-09-17
- 微软 MarkItDown 斩获 10 万星:任意文件一键转 Markdown — mdancho84 · 2026-09-17
- LLM agent 从 demo 到生产会先死在哪?工具响应、上下文与重试循环成重灾区 — Substantial_Bus_5237 · 2026-09-17
- GitHub 用 Copilot 把自家 agent 运行时重写为 80 万行 Rust — mariorod1 · 2026-09-17
- 「上下文与代码同住」:开发者重提 Knuth 的 literate programming — carsonfarmer · 2026-09-17