Zhipu AI ускоряет инференс GLM: технология ZCube сокращает затраты на кластеры на 33%.
Разработчики Zhipu AI сообщили о внедрении новой технологии ZCube, направленной на оптимизацию ИИ-кластеров. Команда проекта изучала подход дезагрегации Prefill-Decode у GLM и представила собственное решение.
ZCube описывается как полностью плоская топология с многорельсовым доступом для распределения трафика по кластеру и достижения превосходной балансировки нагрузки.
В рамках работы с моделью GLM-5.1 применение ZCube позволило сократить затраты на закупку коммутаторов и монтаж оптических магистралей на 33%. Одновременно с этим пропускная способность узлов GPU при выполнении инференса увеличилась на 15%, а время отклика кластера снизилось более чем на 40%.
ZCube позиционируется как решение для суперкластеров ИИ, начиная от десятков и сотен тысяч GPU. Это действительно важное событие: американские LLM сегодня во многом держатся за счет архитектуры NVLink от Nvidia, и разработчики из Zhipu AI последовательно сокращают ее значение. В любом случае, модель стала заметно быстрее, что подтверждается практическими, а не только академическими результатами.
Источник: x.com

