fix: keep async rollouts version-consistent
- serialize shared-model optimizer updates with generation - reject future or over-lagged rollout results after asynchronous scoring - close cache publication races - persist policy versions in online checkpoints
This commit is contained in:
@@ -355,5 +355,6 @@ class TrainContextBuilder:
|
||||
generator=generator,
|
||||
reward_model=cfg.reward_model_fn(),
|
||||
rollout_interval=cfg.rollout_interval,
|
||||
max_policy_lag=cfg.rollout_max_policy_lag,
|
||||
)
|
||||
)
|
||||
|
||||
Reference in New Issue
Block a user