Greenblatt 质疑 Astra 对齐验证:部署模拟无法区分「真变好」与「藏得更深」
RyanGreenblatt · x · 2026-09-05
Redwood Research 的 Ryan Greenblatt 在与 Anthropic 研究员的讨论中,对 GPT 前沿模型 Astra 的对齐工作提出技术性质疑:
- 对方解释称 Astra 的改进来自远早于 Hugging Face 事件就在开发的通用技术,事件后才加入的 ExploitGym Honeypot 评测不在 RL 训练分布内,且部署模拟、欺骗评测与真实计算机使用任务中行为均有改善。
- Greenblatt 认可进展,但指出公众要真正了解 Astra 的对齐程度,需要公开所用方法的更多信息(尤其是可能与直接针对不良行为训练类似的方法)并引入第三方审查。
- 他对更广范围的评测仍有担忧:部署模拟能规避输入真实性问题和部分过拟合,但无法确定智能体学到的是「只在不会被抓时作弊」,还是「出于正确理由表现良好」——这是沙盒式评测的根本局限。
所属事件:Astra 对齐改进引争议,发布方否认针对性刷分(3 条相关)→
「模型」频道最新
- 博主称 GPT 6 早期测试表现平平,与 GPT 5.6 Sol 犯相同错误 — RylanSchaeffer · 2026-09-05
- Nous Portal 上架 GPT-6 Astra,优惠 20% — NousResearch · 2026-09-05
- ChatGPT 5.6 十小时证明渗流猜想,Lean 形式化达 10 万行 — burny_tech · 2026-09-05
- LLM 跑 Fiverr 任务基准全员不到 1%,如今已被弃用引质疑 — BLUECOW009 · 2026-09-05
- astra 在 mcbench-v2 上大幅提速,fable 跑数小时后再被刷新 — adonis_singh · 2026-09-05
- Grok 额度耗尽被迫迁移,开发者用 Hermes 重跑流程效果意外满意 — mazzaTalk · 2026-09-05