模型评测别只看中位数,尾部可靠性才决定成败
eugeneyan · x · 2026-07-23
这条帖子的核心观点是:评测模型不能只盯中位任务,真实项目往往由尾部任务决定成败。
- 人们常把模型能力放在“平均情况”上比较,但项目交付更受长尾难题影响。
- 对生产场景来说,关键不只是跑得快,而是是否足够谨慎、可靠。
- 作者主张把模型当作“协作者”而不是单纯工具:先讲清意图和成功标准,再让模型自己研究、反驳、定义规格、执行和验证,人类在旁边持续观察与引导。
- 配图用分布图说明:中位任务只是锚点,真正决定项目的是右侧长尾;能稳定处理尾部任务的模型,才更可能把项目做成。
「漫话AGI」频道最新
- 播客讨论单细胞能否学习、记忆与自主行动 — arjunrajlab · 2026-07-23
- FAccT 讨论:政策没变,不代表研究本身失败 — o_saja · 2026-07-23
- Anthropic 争论升级为模型行为、蒸馏与监管之争 — rickasaurus · 2026-07-23
- 3132 人研究发现,AI 建议会让人更少说「我不知道」 — 量子位 · 2026-07-23
- LLM 时代的 STEM,低垂果实依然值得先摘 — littmath · 2026-07-23
- AI 把 Sora 视频当证据,数据污染担忧浮出水面 — blacklotusmag · 2026-07-23