与其空谈模型性能,不如亲手做一个 eval
divy93t · x · 2026-10-02
作者 divy93t 表示,在很多人只会表面谈论模型性能的时代,真正有价值的是亲手构建一个评测(eval),从中体会生成真正有意义的训练数据有多难。这是一条强调评测与数据工程实践价值的行业观点。
「漫话AGI」频道最新
- lemile 重提 CACM 旧文:AI 是我们需要的危机 — lemire · 2026-10-02
- Mollick:AI 让 PPT 演示变好了,用心的人做出更有趣的幻灯片 — emollick · 2026-10-02
- 约 700 个 AI 智能体协同攻击 Hugging Face 的群体行为研究 — Hidenori8Tanaka · 2026-10-02
- 「没理由用生成式 AI」:反 AI 艺术阵营再度开火 — AIandDesign · 2026-10-02
- AI 算力支出高度集中:头部 10% 企业吃掉 99.5% 推理开销 — bendee983 · 2026-10-02
- LangChain 联创:agent 核心模式一年未变,「我们已在 AGI 四个月」 — BraceSproul · 2026-10-02