ViperEkura
a5b238dd86
feat: add fp8 training via cublasLt dispatch
- fp8_mm kernel (csrc): cublasLt fp8 e4m3 gemm, TN layout mapped zero-copy
- custom::fp8_mm custom op: meta/cuda/cpu kernels + scale-corrected bf16 autograd
- aten::linear and linear_backward dispatch on CUDA key, zero model changes
- per-tensor scale or raw cast; single-GPU smoke loss matches bf16
2026-08-14 00:39:49 +08:00
..
2026-07-31 15:36:32 +08:00
2026-08-05 15:37:22 +08:00
2026-08-09 23:12:53 +08:00
2026-08-09 23:12:53 +08:00
2026-08-14 00:39:49 +08:00
2026-08-14 00:39:49 +08:00
2026-08-14 00:39:49 +08:00
2026-07-31 16:52:25 +08:00
2026-07-31 16:52:25 +08:00