John Schulman: Using Prefixes from Misbehaving Trajectories to Define RL Environments Is a Good Idea

johnschulman2 · x · 2026-08-09

OpenAI co-founder John Schulman responded on X, agreeing that using prefixes from misbehaving trajectories to define RL environments or evals is a good idea, suggesting a method to leverage failure cases for improving reinforcement learning.

Related event: Schulman Discusses Using Bad Trajectory Prefixes for RL(2 posts)→

Original post →

More from Research

Research channel →