ViperEkura
a5b238dd86
feat: add fp8 training via cublasLt dispatch
- fp8_mm kernel (csrc): cublasLt fp8 e4m3 gemm, TN layout mapped zero-copy
- custom::fp8_mm custom op: meta/cuda/cpu kernels + scale-corrected bf16 autograd
- aten::linear and linear_backward dispatch on CUDA key, zero model changes
- per-tensor scale or raw cast; single-GPU smoke loss matches bf16
2026-08-14 00:39:49 +08:00
..
2026-08-09 23:12:53 +08:00
2026-08-09 20:23:58 +08:00
2026-08-09 20:52:06 +08:00
2026-08-09 20:52:06 +08:00
2026-08-09 23:12:53 +08:00
2026-08-09 23:12:53 +08:00
2026-08-10 08:40:18 +08:00
2026-08-09 20:23:58 +08:00
2026-08-09 20:52:06 +08:00
2026-08-09 23:12:53 +08:00
2026-08-10 08:40:18 +08:00
2026-08-10 08:40:18 +08:00
2026-08-09 20:52:06 +08:00
2026-07-27 00:35:34 +08:00
2026-08-14 00:39:49 +08:00
2026-08-02 13:20:14 +08:00