NVIDIA ускоряет файнтюнинг больших MoE-моделей с помощью NeMo AutoModel и сохраняет привычный API Hugging Face.
NVIDIA показала, как ускорить fine-tuning больших MoE-моделей практически без переписывания кода.
Инструмент NeMo AutoModel работает поверх Hugging Face Transformers v5 и сохраняет знакомый API: по сути, достаточно изменить один import, а дальше можно использовать привычный from_pretrained().
Что внутри:
- Expert Parallelism
- DeepEP для быстрого dispatch между экспертами
- TransformerEngine kernels
- FSDP2
- совместимость с HF checkpoints
Главный результат: на Qwen3-30B-A3B и Nemotron 3 Nano 30B-A3B fine-tuning стал в 3.4–3.7 раза быстрее, а потребление GPU-памяти снизилось на 29–32%.
Для больших MoE это важно: проблема уже не только в параметрах, а в том, как эффективно распределить экспертов, токены и коммуникацию между GPU.
Вывод простой: fine-tuning frontier-scale моделей всё больше становится не задачей «запустить Trainer», а задачей правильной distributed-инфраструктуры.

