vLLM [Нейросеть/модель]
vLLM — это высокопроизводительный open-source движок для инференса и обслуживания больших языковых моделей, разработанный в UC Berkeley. Его ключевая инновация — технология PagedAttention, которая эффективно управляет памятью при обработке запросов, а непрерывная пакетная обработка (continuous batching) позволяет динамически добавлять новые запросы в очередь, что значительно повышает пропускную способность и скорость генерации . Благодаря оптимизированным CUDA-ядрам и поддержке квантизации, vLLM обеспечивает API, совместимый с OpenAI, и позволяет запускать модели на различных типах оборудования.

