4b37f289c07850296ebcc1151649ab5fc3be2b97
The muon-25bt (Muon, 25B) vs kami/norm (AdamW, 15B) comparison confounds optimizer choice with training duration. Reframe as "Muon produces larger post-convergence weight variance" rather than "training duration drives variance growth."
Description
No description provided
6.3 MiB
Languages
TeX
100%