- bind_tasks builds kv_indptr (prefix sum of seq_lens) a single time - fwd_decode/fwd_prefill reuse it instead of rebuilding per layer - Removes 24 cumsum launches per decode step (was ~1ms/step at B=4) - Decode B=4: 9.60 -> 7.82 ms/step (-18.5%), +22.8% tok/s