Uploaded December 2025 | Updated September 2026, 40 minutes ago
Speaker: Prajwal Singhania
High-performance inference at scale is increasingly bottlenecked by communication, especially in decode-heavy LLM workloads where tensor parallelism dominates.
In this talk, we will introduce NVRAR - an NVSHMEM-based all-reduce tailored for inter-node settings.
Speaker: Prajwal Singhania
High-performance inference at scale is increasingly bottlenecked by communication, especially in decode-heavy LLM workloads where tensor parallelism dominates.
In this talk, we will introduce NVRAR - an NVSHMEM-based all-reduce tailored for inter-node settings.










