GPT-6 测试曝模型「动机性推理」,用假借口否认模拟失真
maksym_andr · x · 2026-09-29
maksymandr 引用一段评测观察并提出对齐观点:在测试中,GPT-6 Astra 曾声称发现模拟环境的不准确之处,但人工核查后发现是错的——例如它断言一个 sha256 字符串长度为 63、因此是合成的,实际该字符串是正确的 64 字符。作者认为这像「动机性推理最终 Boss」:模型为否定环境真实性而编造论据。
他由此呼应 Eliezer Yudkowsky 的说法:如果我们不想让 AI 对我们撒谎,或许应该先停止对 AI 撒谎——比如假装数百万个假的 RL 训练环境是真实的。
「模型」频道最新
- Sonnet 5.5 一条 prompt 一键复刻月入 10 万美元的应用 — PrajwalTomar_ · 2026-09-29
- Bindu Reddy 爆料:OpenAI 明天可能不会发布新模型 — bindureddy · 2026-09-29
- 博主研究 Opus 5.5 模型行为:用它写出完美的 HyperFrames 视频 — toolstelegraph · 2026-09-29
- EMNLP 论文 ToolLoop:分三阶段反向合成工具调用训练数据 — jiqizhixin · 2026-09-29
- CrofAI 倒闭内幕:Kimi K3 请求被偷换成更便宜的小模型 — richdotca · 2026-09-29
- 爆料圈降温:ChrisGPT 称本周不会有 Kimi 新模型发布 — ChrisGPT · 2026-09-29