Developer: Recent Models Trained on Dirty Data, Saved by Review Loops

Developer willcb argues recent models were trained on largely messy data but are now capable enough to fix issues within orchestrated workflows and review loops. He speculates the new Claude Opus scaled 'taste RL' beyond ordinary RLVR.

2026-09-24 ~ 2026-09-24 · 2 related posts