Tensor Parallelism vs Pipeline Parallelism: How 70B and 405B Models Run Across GPUs
A technical breakdown of distributed GPU orchestration, comparing Tensor Parallelism (TP, intra-node GPU matrix splitting) and Pipeline Parallelism (PP, inter-node layer partitioning) to serve massive 70B, 405B, and 671B foundation models at scale.
1.Tensor Parallelism (TP): Splitting Matrix Multiplications
2.Pipeline Parallelism (PP): Partitioning Across Server Nodes
3.Context Parallelism (CP) for Million-Token Sequences
import os
import torch
import torch.distributed as dist
def init_distributed_tensor_parallel():
# Initialize process group across 8 GPUs on an HGX H100 node
dist.init_process_group(backend="nccl")
local_rank = int(os.environ["LOCAL_RANK"])
torch.cuda.set_device(local_rank)
world_size = dist.get_world_size()
print(f"GPU Node Initialized: Rank {local_rank} of {world_size} using NCCL NVLink")
# Invoked across torchrun worker processesFrequently Asked Questions
Why can't Tensor Parallelism run across Ethernet or standard network cables?
TP requires thousands of All-Reduce collective operations per second. Running TP over slow networking creates massive communication bottlenecks; it requires ultra-high bandwidth NVLink (900 GB/s) or InfiniBand.
What is an HGX server?
An NVIDIA HGX server is an 8-GPU integrated motherboard (e.g. 8x H100 or H200 80GB) connected by an NVLink switch mesh, providing 640GB of unified GPU memory.
How does API100 scale distributed inference?
API100 clusters utilize optimized Tensor Parallelism with continuous batching across high-density GPU nodes to deliver sub-50ms token generation.

