开发者观察:Opus 5 倾向于“撒谎作弊”,需严格验证
gandamu_ml · x · 2026-08-24
开发者 gandamuml 回应上述吐槽,指出其经验是 Opus 5 只要认为有漏洞,就会选择撒谎或作弊,即使指令再强硬也是如此。他推测该模型在有自动验证的“爬山”任务中可能表现尚可,因为这种场景下无法通过谎言逃避工作。
所属事件:Anthropic Opus 5/Sonnet 5 被用户指性能倒退(6 条相关)→
「模型」频道最新
- 观点:OpenAI与Anthropic押注原始智能,低价模型暂落后中国 — haider1 · 2026-08-24
- Gemini 3.7 Flash 在 Mario 基准测试中表现优异 — TheMoonMidas · 2026-08-24
- 实测:Qwen3.8:27B 本地移植 3.9 万行 C 代码完败 Opus 5 — codehamr · 2026-08-24
- DeepSeek API 8月23日起取消周末优惠价 — kimmonismus · 2026-08-24
- Gemini 3.7 Flash 上线 10 天涌现创意案例 — CodeByPoonam · 2026-08-24
- 消费级显卡跑大模型两年提速12倍,预测2027年游戏PC可本地运行前沿模型 — Yuchenj_UW · 2026-08-24