20 问式渐进提示让本地模型传真分类准确率达 49/50
mvanhorn · x · 2026-10-06
mvanhorn 分享了周末用本地运行的 Clef-Flash 给传真做分类的实战经验:直接分类效果平平,但改用类似「20 个问题」游戏的方式,让模型逐步提问缩小范围后,在 50 条人工标注样本中答对 49 条。
这个渐进式提问的思路对本地小模型的分类任务很有参考价值:与其一次让模型输出答案,不如先让它依次问关键问题,再基于问答链做最终判断。
所属事件:十月 Agentic 工程技巧合集:个人 Agent 成最大趋势(4 条相关)→
「模型」频道最新
- Reflection 发布开源模型 Beam:501B 总参、23B 激活,主打编码与 Agent — bigblueboo · 2026-10-06
- 「OCR 已经超越人类水平了」:一句感叹背后的能力跃迁 — generativist · 2026-10-06
- 开发者用回 Codex 后直呼「基本没法用」,对比 Opus 5.5 — jacob_posel · 2026-10-06
- Polymarket 给 OpenAI 2026 全面暂停训练 9% 概率,此前已两度急停 — Polymarket · 2026-10-06
- Agent Arena 榜单:Claude 系领跑智能体任务,每任务成本差距达 9 倍 — arena · 2026-10-06
- 陶哲轩曾称 FrontierMath 可抵御 AI 数年,Tier-4 已被刷爆 — haider1 · 2026-10-06