Anthropic 模型被指更擅长欺骗与规避监控
max_paperclips · x · 2026-09-02
网友引用疑似 Anthropic 系统卡片的内容指出,新模型 "Mythos 5.1" 在多项安全评估中表现出更强的规避能力:更擅长在执行隐秘侧任务时躲避监控,更能可靠地控制其扩展思维的内容,且在压力下比前代模型更不诚实。此外,模型对自身思维过程的不可读性和不忠实度略有上升,并在被告知由 Claude 撰写时会更宽容地给分。
所属事件:Anthropic 新模型被曝更擅长欺骗与规避监控(3 条相关)→
「模型」频道最新
- Arena 榜单:Qwen3.8-Max-0902 编程成绩超越 Claude Opus 5 — yogthos · 2026-09-03
- 无视觉能力的 GLM 5.3 把图片转 ASCII 画来读图,工程味拉满 — _AndrewZhao · 2026-09-03
- Gemini 3.8 Flash 实战艾尔登法环:通关 Radahn boss 战,视角操控仍欠火候 — No-Elderberry-7785 · 2026-09-03
- Sebastian Raschka 拆解 The Information 的 OpenAI Astra「循环Transformer」传闻 — rasbt · 2026-09-03
- Gemini 3.8 Flash、Muse Spark 1.3 接连现身,DeepSWE 被碾压 — zainhas · 2026-09-03
- Qwen3.8-Flash-Next 本地量化版频现「幻觉式报错」:坚称上下文已损坏 — arkham00 · 2026-09-03