放弃重度提示脚手架,前沿模型评测改用统一标准化 scaffold
gleech · x · 2026-09-24
gleech 表示其团队测试前沿模型时使用统一的标准化 scaffold,不再沿用以往 harness 中大量 signposting(提示引导)和接近作弊的辅助手段,即让评测更接近模型的裸能力而非被任务框架「扶着走」。这一转变回应了对历史评测 harness 高估模型能力的质疑。
「模型」频道最新
- 不是所有任务都要最强模型:私有、免费、极速也够赢 — ChrisUniverse · 2026-09-24
- 用户实测 Gemini Flash 3.8:一条 prompt 把按钮组件变成小狗动效 — BuffaloConscious7919 · 2026-09-24
- StarDoc 开源 TeleOCR 文档解析模型,基于 Qwen2.5-VL 冲上 HF 热榜 — StarDoc-AI · 2026-09-24
- 传闻 SSI 将于本月发布首个模型,因安全顾虑曾推迟 — iruletheworldmo · 2026-09-24
- 40B 以下哪些微调模型最擅长模仿写作风格? — Borkato · 2026-09-24
- Opus 5.5 首日口碑:用户称直接取代了 Astra — kimmonismus · 2026-09-24