Efficient MoE Training for Biological Foundation Models
As language models grow, scaling dense architectures becomes increasingly expensive. In a dense transformer, every token passes through every layer, so adding...
Sources
- T1Efficient MoE Training for Biological Foundation ModelsNVIDIA — Blog / Technical Blog / Newsroom