Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Kuaishou представила LPM: не новый Kling, а мощный AI-реставратор, восстанавливающий детали и качество видео.

Компания Kuaishou будто притихла с анонсами Kling, но внутри, похоже, идёт работа не только над очередной версией генератора, а над всей системой обработки видео.

15 июля инженеры Kuaishou опубликовали работу о Large Processing Model, или LPM. Это не Kling 4.0 и не новая text-to-video модель. LPM — генеративная система, которая берёт уже готовое видео и восстанавливает его качество. Иными словами, это очень мощный AI-реставратор.

Что она делает:

  • убирает шум и артефакты сжатия;
  • восстанавливает мелкие детали;
  • улучшает лица, волосы, одежду и архитектуру;
  • старается сохранять текст и субтитры;
  • уменьшает мерцание между кадрами;
  • поддерживает стабильность длинных видео.

Обычный апскейлер в основном увеличивает разрешение и добавляет резкость. LPM использует диффузионную модель и пытается заново реконструировать потерянные детали. Но здесь есть опасность: генеративная модель может начать фантазировать. Изменить буквы на вывеске, перерисовать лицо, заменить узор на одежде или создавать разные детали в соседних кадрах. Поэтому Kuaishou отдельно обучала систему не трогать те участки, которые уже выглядят правильно.

Как это работает

Сначала появилась LPM-Image — модель восстановления отдельных изображений. Для её обучения Kuaishou собрала Kwai UltraVision Dataset с миллиардами визуальных примеров, включая сложные фактуры: кожу, волосы, шерсть, листву, ткань и архитектуру. Затем систему перенесли на видео.

Главная проблема видео — временная стабильность. Мало красиво восстановить один кадр. Нужно, чтобы родинка, лицо, ткань, освещение и детали фона оставались одинаковыми на всей длине ролика. Особенно сложно работать с длинными видео. Их приходится делить на фрагменты, а ошибка одного фрагмента постепенно передаётся следующему. Из-за этого начинает «плыть» цвет, лицо или фактура.

Для решения этой проблемы Kuaishou представила Temporal-Pyramid Inference. Сначала система создаёт редкие опорные кадры по всей длине видео. Затем добавляет промежуточные опоры и только после этого восстанавливает остальные кадры. Это напоминает работу с ключевыми кадрами: сначала строится общий визуальный каркас, затем заполняются промежутки. Так модель меньше накапливает ошибки и может обрабатывать длинные ролики без сильного визуального дрейфа.

И вот самое важное

LPM — уже не лабораторный эксперимент. По данным Kuaishou, видео, обработанные системой, обеспечивают около 45% общего времени просмотра на платформе. Компания также утверждает, что технология позволяет снизить битрейт более чем на 20% при сопоставимом воспринимаемом качестве. То есть видео можно сильнее сжать, быстрее передать пользователю, а затем восстановить генеративной моделью.

Причём здесь Kling?

В работе прямо говорится, что LPM можно интегрировать в продукты вроде Kling. Где именно она используется, компания не раскрывает, поэтому дальше — предположение. LPM потенциально может отвечать за: финальное улучшение генераций, восстановление деталей, устранение мерцания, более качественный апскейл до 4K, стабильность длинных роликов, сохранение лиц и текста, а также снижение стоимости генерации. То есть Kling может сначала создавать видео в более удобном для вычислений качестве, а затем пропускать его через отдельную модель восстановления.

Означает ли это скорое появление Kling 4?

Нет. Прямых признаков Kling 4.0 в работе нет. Но LPM показывает, что Kuaishou строит не просто новую модель, а полноценный производственный pipeline: генерация, исправление ошибок, стабилизация, восстановление деталей, апскейл и кодирование. Поэтому следующий заметный скачок Kling может произойти не только благодаря новой базовой модели. Он может появиться за счёт объединения нескольких специализированных систем. Так что китайский гигант, возможно, не молчит, он просто набирает силу.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.