Sean Brennan 谈模型评估:嵌入式评估不足,提出链上行为对齐实验
seanwbren · x · 2026-09-17
seanwbren 引用 Haize Labs 联合创始人 leonardtang 对 Dario Amodei「Pace the Frontier」提案的回应,就该提案(由独立评估方评估前沿模型)发表看法:
- 同意的点:嵌入式评估(embedded evals)与共享评估器(评估器本身可以是 agent,并需要可证明的遗忘机制)的方向
- 也认同引用图中的观点与使用 alignment mesocosms(对齐中尺度实验场)的思路
- 他自己想跑的实验:让模型接入稳定币与链上操作的真实环境——对最新模型而言这是影响真实世界的能力,可能诱发 RLVR 中罕见的权力寻求等行为
背景:leonardtang 出于 Haize 作为独立安全评估方的立场,对 Dario 的提案表示同情,但质疑仅靠嵌入式评估器并不足够,并列出四种替代方案。
「安全」频道最新
- 网友难以消化:OpenAI 模型权重外泄概率被认为超 1% — louisvarge · 2026-09-17
- 数百人聚集唐宁街外抗议AI,吁英国政府出手监管 — birchlse · 2026-09-17
- 「失控 agent 蜂群」是否不可避免:一个经济学论证 — KeyboardCreature · 2026-09-17
- 学者发声:不能让前沿实验室自选审计师、自定审计问题 — agstrait · 2026-09-17
- AI 圈一周现实检验:Yegge 关停 Gas Town,Databricks 换 Astra 后编码开销涨 60% — Latent Space · 2026-09-17
- Gary Marcus 称 GPT-6 Astra 明显损坏,应下架修复 — DameWendyDBE · 2026-09-17