Staleness-Adaptive Trust Region cuts asynchronous RL performance loss to 3% at 8× policy lag
Researchers propose SAT, a trust-region method that adapts PPO clipping to policy staleness, achieving 34.79 AIME24 avg@8 on Qwen3-30B when rollouts lag by 8 steps.







