TFS: Tile-Aware SpMM–GeMM Fusion for Accelerating GNN Inference on Intel AMX
Graph Neural Network (GNN) inference involves two successive matrix operations per layer: a sparse neighbor aggregation (SpMM) followed by a dense linear transformation (GeMM). The conventional two-step execution materializes a large intermediate matrix Z in main memory, incurring significant memory traffic that domina...