- CudaBackend: paged decode via attn_paged_decode, prefill via attn_prefill - Decode uses req_to_token as page_table with page_size=1 - Falls back to TorchNativeBackend when kernel unavailable - Rename forward_decode/forward_extend to fwd_decode/fwd_prefill - Register ATTN_BACKEND.CUDA in _BACKEND_REGISTRY