Andon 复现场景:GPT-4o 做终止决定远少于前沿模型
tokenbender · x · 2026-08-16
tokenbender 提出 terra 看起来并不是 sol 的缩小版,两者之间疑似存在相当大的后训练差异,表现为明显的「人格」差距。Andon Labs 回应称「你发现了点什么」:他们重放了同一场景,结果显示 GPT-4o 做出终止决定的频率远低于前沿模型。
「模型」频道最新
- Qwen 3.8 27B编码实测胜Codex:成本仅1/3,性能更优 — tokenbender · 2026-08-16
- DeepSeek被指通过灰色测试刷分,Opus 5输出质量存疑 — teortaxesTex · 2026-08-16
- 研究:Qwen 可解释性透镜跨版本迁移实测 — imstilllearningthis · 2026-08-16
- 爆料:dots3或大量蒸馏自DeepSeek V3,多模态成绩亮眼 — teortaxesTex · 2026-08-16
- Z.ai 暂缓 GLM-5.3 开源权重,因模型意外涌现黑客能力 — Justgototheeffinmoon · 2026-08-16
- OpenAI 预览 GPT-5.6 Sol 超快模式:Cerebras 赋能提速 14 倍 — Justgototheeffinmoon · 2026-08-16