GPU-Centric Stateless LLM Serving With GIGANETS
Giganetes is a GPU-centric architecture for stateless LLM serving that externalizes KV caches to a disaggregated remote memory pool via GPUDirect RDMA, eliminating session affinity constraints and enabling near-linear horizontal scaling in a Kubernetes-native deployment.