- SFT: 1,000 steps/WSD → ~3,800 steps/cosine; loss ~2.5→1.6 → ~2.1→1.5 - DPO: fix preference-loss narrative to match training-loss curve; correct initial grad-norm (~50 → ~200) - Table 2: peak LR 1.5e-4 → 2.0e-4 (matches pt_metric.png) - Clarify scheduling: pretraining=WSD, SFT+DPO=cosine - Add disclaimer to ckpt_weight_density_per_run caption for legacy iter labels
84 KiB
1500x380px
84 KiB
1500x380px