grouped-nf4-gemm 0.33.3
Triton kernels for 4-bit MoE inference: grouped NF4/MXFP4 GEMM, INT4 GEMV, FP8 paged attention, and CPU/NVMe expert streaming.
Sources
- T1grouped-nf4-gemm 0.33.3PyPI / crates.io / RubyGems / Go index / NuGet
Triton kernels for 4-bit MoE inference: grouped NF4/MXFP4 GEMM, INT4 GEMV, FP8 paged attention, and CPU/NVMe expert streaming.