Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Cohere ускорила LLM inference на H100 с помощью megakernel: до 1,58× быстрее vLLM.

Cohere ускорила LLM inference на H100 с помощью megakernel. Решение показывает до 1,58× более высокую скорость по сравнению с vLLM.

Обычный инференс состоит из десятков отдельных GPU-ядер: QKV, attention, MoE, RMSNorm и других. Между ними GPU ждёт синхронизацию и новые kernel launches. Cohere собрала весь decode step в один persistent megakernel.

Результаты на North Mini Code

  • 292 tok/s при batch size 1;
  • против 185 tok/s у vLLM;
  • использование теоретического bandwidth H100 выросло с 39% до 62%;
  • ускорение сохраняется вплоть до 256K context;
  • без измеримой потери качества.

Выигрыш достигается за счёт меньшего количества kernel launches, меньшего числа глобальных barriers, лучшей загрузки SM, prefetch весов и меньшего простоя GPU.

Это уже не только лабораторный benchmark: система поддерживает continuous batching, paged attention, ragged sequences, tool calling и OpenAI-compatible API.

Megakernel реализован в одном CUDA-файле без отдельного compiler stack.

Подробнее: https://cohere.com/blog/megakernels

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.