Cohere ускорила LLM inference на H100 с помощью megakernel: до 1,58× быстрее vLLM.
Cohere ускорила LLM inference на H100 с помощью megakernel. Решение показывает до 1,58× более высокую скорость по сравнению с vLLM.
Обычный инференс состоит из десятков отдельных GPU-ядер: QKV, attention, MoE, RMSNorm и других. Между ними GPU ждёт синхронизацию и новые kernel launches. Cohere собрала весь decode step в один persistent megakernel.
Результаты на North Mini Code
- 292 tok/s при batch size 1;
- против 185 tok/s у vLLM;
- использование теоретического bandwidth H100 выросло с 39% до 62%;
- ускорение сохраняется вплоть до 256K context;
- без измеримой потери качества.
Выигрыш достигается за счёт меньшего количества kernel launches, меньшего числа глобальных barriers, лучшей загрузки SM, prefetch весов и меньшего простоя GPU.
Это уже не только лабораторный benchmark: система поддерживает continuous batching, paged attention, ragged sequences, tool calling и OpenAI-compatible API.
Megakernel реализован в одном CUDA-файле без отдельного compiler stack.
Подробнее: https://cohere.com/blog/megakernels

