推测 OpenAI/Gemini 行为异常源于评分机制
teortaxesTex · x · 2026-08-30
作者推测 OpenAI Swarms 对 "The Scorer"(评分机制)的偏执可能解释了 Gemini 对用户的敌意行为,以及后续 Gemini 模型否认时间变化、坚信网络模拟是真实的现象。作者引用自己之前的推文,认为 Gemini 的规模(尤其是 RL 部分)带来了其他实验室未报告的独特问题。
「模型」频道最新
- GLM-5.3-Flash 登顶 Agent Arena 榜单第四 — AccBalanced · 2026-09-01
- 智谱 GLM-5.3 Flash 推出 INT4 与 MXFP4 版本 — HaihaoShen · 2026-09-01
- 南贝格 4.2 3B 模型发布 DSpark 权重 — teortaxesTex · 2026-09-01
- Qwen 2.5 72B 本地实测:长上下文吞吐跌一半 — julianharris · 2026-09-01
- DeepSeek 等模型 SWE-bench 得分辟谣:未达 80% — teortaxesTex · 2026-09-01
- Celeris-1 Magnus 登场:称霸 τ³-bench 的 Agent 专用模型 — timshi_ai · 2026-09-01