Apollo CEO:嵌入评估器是好趋势,但安全评估远不止这些
MariusHobbhahn · x · 2026-09-20
Marius Hobbhahn(Apollo Research CEO)对前沿模型公司引入「嵌入评估器」(embedded evaluators)的传闻表态:如果真能按所说落地,这是好趋势。
但他提醒这远不够,行业还需要:
- 对训练过程本身做评估(training run evaluations)
- 更深入的 scheming / 失对(misalignment)科学研究
- 更好的控制(control)手段
观点核心是:不要因为一个评估机制就认为安全工作已经完成,前面还有大量更难的工作。
「安全」频道最新
- 学者做客 CBS:AI 透明度不该靠诉讼倒逼,需独立监督机制 — chrismattmann · 2026-09-20
- Gary Marcus 警告:AI 智能体 swarm 散布虚假信息的噩梦正在成真 — GaryMarcus · 2026-09-20
- Gary Marcus 警告:AI agent 大军生成假信息正成现实 — GaryMarcus · 2026-09-20
- Gary Marcus:AI 智能体群散播虚假信息警报正在应验 — GaryMarcus · 2026-09-20
- Andrew Yang 称网络已被自复制 AI 代码污染,仅二手信源 — alex_verem · 2026-09-20
- GLiNER2 作者发声:Jev 的能力并不新,我们的模型早已开源 — philipvollet · 2026-09-20