花 20 美分测试「不会写句子」的 AI,却补上了分类器漏掉的 13 条请求
mikegiannulis · x · 2026-09-18
作者分享一次反直觉的实测:用一个连完整句子都写不好的小模型,仅花 20 美分做测试,却抓住了自家客服支持分类器漏掉的 13 条客户请求,并在检索源文档时把正确段落排到第一名的比例从 60% 提升到 90%。他的结论是:业界可能把 LLM 用错了地方——很多场景并不需要能写漂亮文章的大模型,小而专的模型在分类与检索排序这类任务上反而更便宜、更有效。
所属事件:TypeSafe 发布决策模型 Jev:不聊天、直接给答案(44 条相关)→
「编程与Agent」频道最新
- AgentSky 发布:浏览器里用 40+ 编程 Agent,同任务成本差 44 倍 — Scobleizer · 2026-09-18
- MiniMax 开源 Code CLI v0.4.12,FrontierHarness 评测 SOTA — MiniMax_AI · 2026-09-18
- MiniMax 开放 Code CLI 编码智能体工具,招募 Agent 范式探索 — MiniMax_AI · 2026-09-18
- AWS 发布六个开源 Skills,让编码代理正确部署 Hugging Face 模型 — AWS ML Blog · 2026-09-18
- 三名普通开发者用 Claude 和 Codex 串起 6 个漏洞完成攻击 — xennygrimmato_ · 2026-09-18
- 科研 agent 框架 Outerloop 0.2.0:持久状态与统一消息收件箱 — mengyer · 2026-09-18