Speculation: OpenAI may internalize reasoning via synthetic CoT rewriting and FiM

cephaloform · x · 2026-09-04

@ueaj speculates OpenAI likely isn't doing looped transformers (MoEUT possible), since RL signal isn't dense enough to saturate frontier math with minimal reasoning; more plausible is synthetic rewriting of CoTs—terse rewrites or dropping segments for next-gen pretraining to fill-in-the-middle, internalizing reasoning into weights. cephaloform confirms using a similar technique for a 2B GAN's reasoning discriminator: mass attempts, FiM-train the CoTs, fill in reasoning for gold answers, then SFT on synthetic chains and RL. Unverified speculation.

Original post →

More from Models

Models channel →