kapynOpen Source

Latent-MoE — Implementation of LatentMoE,Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts (Elango et al., NVIDIA

Latent-MoE is a drop-in PyTorch layer implementing NVIDIA's efficient Mixture of Experts architecture. The dependency-light module optimizes accuracy per FLOP and parameter compared to standard feed-forward networks. Developers can easily integrate the single-file implementation into existing large language model pipelines for improved efficiency.

GitHub·Jul 21, 2026

Opening Kapyn…