- schedule.py: guard warmup_steps/lr_decay_steps against zero - strategy.py: use ~loss_mask instead of loss_mask==0 on bool tensor
- schedule.py: guard warmup_steps/lr_decay_steps against zero - strategy.py: use ~loss_mask instead of loss_mask==0 on bool tensor