Trajectory Labs Calls for Rethinking RL with Per-Token, Non-Verifiable Rewards

brianryhuang · x · 2026-08-18

Trajectory Labs argues it's time to rethink RL: translating real-world usage into model improvements requires redesigning post-training algorithms around non-verifiable, per-token rewards. They will share insights on scaling algorithms like SDPO for continual learning at aiDotEngineer's World Fair.

Original post →

More from Research

Research channel →