新博客评估 OpenAI 可监控性评估的弱点
TuhinChakr · x · 2026-08-25
Connor Dilgren 与 Sarah Wiegreffe 发布了一篇关于 OpenAI 的 Monitorability Evals 的新博客文章。文章指出了他们在使用这些评估时发现的一些弱点,并鼓励大家在该方向进行更多研究,特别是关于思维链可监控性的评估。
「研究」频道最新
- AI 行业乱象:传统 ML 学者抨击生成式 AI 过度营销 — wandb · 2026-08-25
- AI Bot 自动攻克数学开放问题实测分享 — latticecut · 2026-08-25
- 上周人形机器人论文精选:含投球机器人在内的多项研究 — carlosdponx · 2026-08-25
- Adobe 提出视频世界模型 LDR,预测世界演化 — _akhaliq · 2026-08-25
- 从 GPT 妖怪问题看 Astra 的持续学习蓝本 — imjustnewatai · 2026-08-25
- 研究:社会科学论文中过度因果主张激增,LLM分析19万篇揭示趋势 — steverathje2 · 2026-08-25