实测 GLM 5.3 Flash 与腾讯 Hy3:谄媚度最低的两款模型对决
ramendik · reddit · 2026-10-06
作者在测试模型谄媚倾向(sycophancy)后,得出两个明显赢家:GLM 5.3 Flash(其烟雾测试中甚至比完整版 GLM 5.3 更不谄媚)和腾讯 Hy3(经由 lechmazur/sycophancy 基准项目浮出水面)。
初步对比:Hy3 风格更紧凑但容易丢细节(加上搜索后好一些);GLM 5.3 Flash 更精确但风格偏泛化。公开基准上 GLM 5.3 Flash 明显胜出,但作者认为基准不完全可信。现征求两类模型在 agentic 循环、编程、通用助手和创意写作上的实战意见。
「模型」频道最新
- 开发者烧700美元Opus 5.5跑通宵,称从未见过模型持续力这么强 — ivan_bezdomny · 2026-10-06
- Anthropic 审核员将威胁警局聊天上报,用户遭逮捕 — rohanpaul_ai · 2026-10-06
- flow-1 发布:RL 训练的 agent 轨迹纠错模型,比 GPT-6-sol 便宜 23 倍 — kalyan_kpl · 2026-10-06
- 首个 3B/8B 规模连续扩散语言模型:低步数推理质量保持更优 — ArashVahdat · 2026-10-06
- 让 Claude 与 Codex 互审 PR:Claude 挑刺一堆,Codex 只点赞 — _lewtun · 2026-10-06
- GPT-6 Astra 与 GPT-6.1 Sol 默认速度提升约 50% 至 50 token/s — kimmonismus · 2026-10-06