Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Новости про vLLM

image
vLLM [Нейросеть/модель]

vLLM — это высокопроизводительный open-source движок для инференса и обслуживания больших языковых моделей, разработанный в UC Berkeley. Его ключевая инновация — технология PagedAttention, которая эффективно управляет памятью при обработке запросов, а непрерывная пакетная обработка (continuous batching) позволяет динамически добавлять новые запросы в очередь, что значительно повышает пропускную способность и скорость генерации . Благодаря оптимизированным CUDA-ядрам и поддержке квантизации, vLLM обеспечивает API, совместимый с OpenAI, и позволяет запускать модели на различных типах оборудования.

Tencent открыл WeVisDoc: сквозной парсер документов на Qwen3-VL с Markdown и LaTeX.
NVIDIA превращает домашние ПК в единый локальный AI-кластер: PAIR и RTX Spark уже на горизонте.
Spark-X2.5-4B: агентная модель на 4B параметров с контекстом 1 млн токенов.
PyTorch Foundation превращается в главный open-source AI-стек, объединив шесть ключевых проектов.
Топ-7 инструментов, чтобы запускать мощные нейросети (LLM) локально и бесплатно. Гид по трендам GitHub!
Бэкенд Transformers в vLLM больше не снижает скорость: прорыв в производительности!
vLLM протестировал DSpark на DeepSeek-V4-Pro: ускорение до 42% против MTP на 8 GPU B300.
Tencent Hunyuan представили UniRL: единая инфраструктура для RL-посттрейнинга любых моделей.
Модель MOSS-TTS-v1.5 от OpenMOSS-Team заняла первое место на Hugging Face.
Китайские кандзи стали новым бенчмарком для VLLM: проверка на 3000 лет эволюции письменности.