「对齐最好的模型」如何定义,圈内激辩衡量标准
Zvi 向 OpenAI 相关人士发问「最有对齐的模型」到底该如何理解,引发圈内讨论。sandersted 认为「更少的不良行为」应以评测和监控来度量,并进一步阐述了自己对「行为更好」的 AI 的定义:从用户、开发者、OpenAI 以及版权持有者、潜在受害者、整个社会等第四方视角,通过评测衡量各方的利益是否得到更好保障。
2026-09-04 ~ 2026-09-04 · 2 条相关
- 「对齐最好的模型」到底什么意思?圈内人争论定义标准 — sandersted · 2026-09-04
- 如何定义 AI「更乖」:以评测与监控度量的不良行为减少 — sandersted · 2026-09-04