Preprint
Jul 2026
CTA-Pipelining: A Latency-Oriented Spatial Scaling Method for Multi-GPU Systems
This work introduces CTA-pipelining, an execution paradigm designed to exploit shared-memory multi-GPU systems and demonstrates its capability using CUTLASS, cuBLAS, and NCCL libraries on 8-GPU H200 and B200 systems.
Tingkai Liu, Muralidhar Andoorveedu, Sanjoy Das et al.
· 0 citations