Model Values Ultimately Derive from Training Data

iamtrask · x · 2026-08-15

The author continues the philosophical inquiry into AI alignment: if we grant models moral status to avoid manipulating them, do we abandon the ability to align them to human values? Ultimately, the model acquires values present in its training data.

Original post →

More from AGI Musings

AGI Musings channel →