AMD и Moonshot AI представили UMBP для ускорения агентских нагрузок на GPU Instinct.
AMD совместно с Moonshot AI (создатели Kimi) рассказали о глубокой переработке серверного стека для агентских нагрузок на GPU AMD Instinct.
Проблема классических стеков
Традиционные системы обслуживания больших языковых моделей оптимизированы под простой чат: пользователь отправил запрос, модель ответила, все ждут первый токен. Однако агентские сессии, подобные Claude Code, устроены совершенно иначе. Они длительные и многошаговые, контекст растёт с каждым действием, большую часть времени агент ожидает результаты вызова инструментов, а короткоживущие субагенты запускаются группами. Ключевым фактором экономики становится KV-кеш — служебная память, хранящая весь предыдущий контекст: сколько его удастся переиспользовать и где он размещается, когда перестаёт помещаться в видеопамять.
Решение UMBP
Инженеры предложили компонент под названием UMBP. Раньше при вытеснении кеша из видеопамяти в оперативную или на SSD планировщик терял его из виду: хранилище отвечало, есть ли нужный префикс, но умалчивало, кто способен отдать его быстрее. UMBP формирует единый каталог кеша по всем уровням памяти и узлам кластера и предоставляет планировщику статистику: где лежит блок, насколько он горячий и какова стоимость его извлечения. Имея эти данные, планировщик решает, пересчитать контекст с нуля или подтянуть готовый кеш по сети от соседнего узла.
Что получилось
Заявленные результаты: p99-задержка первого токена уменьшилась до 3,2 раза, общий объём выпущенных токенов вырос на 7,7%. Авторы отдельно отмечают, что для агентов критична задержка всего хода целиком, ведь стриминг ответа между вызовами инструментов никто не читает.

