模型行为评测需要公共基础设施
ChowdhuryNeil · x · 2026-07-12
核心观点是:模型行为才是我们真正要监测和约束的对象,因为有害模型最终必须通过“行为失当”来造成伤害。作者指出,当前业界对模型行为的理解仍然很有限,而且对“什么算好的行为评测”也没有共识。
文中进一步提出,需要建立一个开放的模型行为评测科学生态,并配套相应的公共基础设施,让外界能在真实世界层面观察、记录和比较模型行为,而不只看能力指标。
「安全」频道最新
- 前 OpenAI、Anthropic 预训练研究员辞职:两公司正赌上人命冲向自我改进超级智能 — ShakeelHashim · 2026-09-11
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11