评 Qwen3.8-27B 别晒聊天截图:先列出它该拒绝的任务清单
Binary_orchid · reddit · 2026-08-20
作者提出一种更实用的本地模型评测思路:与其罗列「视觉、视频、思考、本地部署」这类名词式卖点,不如用三个小 fixture 实测——一个带测试的短代码修复、一个答案取决于可核对细节的图像任务、一个保留源行的长文档问答,重点保留失败样本(看似流畅但改错文件、看错细节的回答直接进拒绝列)。作者认为官方卡片应界定使用边界,本地记录应写清 checkpoint、量化、运行时、上下文目标、思考模式、输入尺寸与判据;若 ZenMux 上线托管路由也只能作参考,无法反映本地显存与吞吐。最有价值的产出是一份「不值得交给这个模型的任务清单」,比又一张干净的聊天截图有用得多。
「模型」频道最新
- 吐槽Google:Gemini 3.7发布一周仍未接入自家Jules智能体 — brandon_galang · 2026-08-24
- Qwen 27B 3.8 极低量化实测:Q3 XXS 可用 — jeremyckahn · 2026-08-24
- 用户反馈 GPT-5.6 近期输出质量显著变化 — haider1 · 2026-08-24
- Ramp 统计 Anthropic 模型使用占比:Opus 4.8 最受青睐 — vista8 · 2026-08-24
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24
- ConvRot 量化方法入驻 llama-cpp,Q6 接近 Q8 精度 — giveen · 2026-08-24