Zvi on Watermarks and Constraints: Not Primarily x-risk Reduction

TheZvi · x · 2026-08-19

Zvi shared views on AI safety, noting that while watermarking makes outputs identifiable and helps contain marginal threat models, he does not primarily see it as reducing x-risk.

Responding to concerns that adding constraints might risk missing safety targets, he emphasized preferring confidence gained through adversarial testing in similar domains over reasoning from first principles, citing unpredictable side effects.

Original post →

More from AGI Musings

AGI Musings channel →