Qwen3.8-27B 人味 LoRA 2.0 发布:支持工具调用,盲测 23.5% 被判为真人
kvyb · reddit · 2026-10-03
作者发布了 Qwen3.8-27B-Humanlike-Chat 2.0(上一版获 700+ 赞、44k 下载),保留"像人发消息"的语气,同时修复 v1 被吐槽的缺陷:不调用工具、听不进指令、单一人格。
2.0 改进
- 无 system prompt 时像普通人发短信;给角色卡即扮演该角色;要求正式邮件/编号步骤/正式解释时能切换,之后回到人味语气;可指令固定全句书写等习惯。
- 工具调用可用:信息缺失时会追问而非瞎编(如订机票会先问出发地);代码和数学约等于基座水平。
训练方法:v1 是 139,845 条消息的纯 SFT,会复制坏习惯;2.0 改用 on-policy distillation——模型自写回复,由两个老师逐 token 打分("像人发消息"隐藏指令版 v1 负责聊天/角色,裸基座负责指令/工具/代码),学生看不到隐藏指令却学到行为。同样 27B 之上第二个 LoRA 合并。
数据:IFBench 37.3→43.7,When2Call 48→58,BFCL irrelevance 60→78;MMLU-Pro 和 LiveCodeBench 略降。自建 "ishuman" 盲测(150 段未见聊天补写、judge 二选一):基座 0.3%、加系统提示 6.8%、官方 Qwen3.8 15.1%、2.0 达 23.5%——证明光靠 prompt 到不了这个水平。16 场真人设多轮对话中 2.0 全胜基座。GGUF 与 LoRA 已上 Hugging Face。
「模型」频道最新
- 128GB Mac Studio M5 Max 实测:Gemma 4 26B 134 tok/s 全对 — TheOyinbooke · 2026-10-03
- Keras 社区电话会:将新增 MLX 与 PaddlePaddle 插拔式后端 — fchollet · 2026-10-03
- Clef 修复视觉输入延迟 bug,图像响应尾部延迟大幅改善 — michellechen · 2026-10-03
- 开源项目 clef 冲上 Hugging Face 趋势榜第三 — michellechen · 2026-10-03
- Arena 周报:Gemini 4 Argon 登顶文本榜,Sonnet 5.5 以 20% 价格逼近 GPT-6 — arena · 2026-10-03
- DeepSeek 开源内核揭密华为昇腾 950:32 AI 核与降功耗提频设计 — teortaxesTex · 2026-10-03