PrismML сжал генеративную модель до 930 МБ. Запускается в браузере и на телефонах.
Стартап PrismML, специализирующийся на экстремальном сжатии моделей, создал квантизированную до одного бита версию FLUX.2 Klein 4B, и результат оказался на удивление достойным. С таким уровнем квантизации Diffusion Transformer занимает всего лишь 930 мегабайт в 1-битном варианте и 1.2 гигабайта в тернарном варианте. Текстовый энкодер так же сильно ужать не удалось, поэтому весь комплект весит около 3.5 гигабайта.
Подобная квантизация позволяет запускать модель прямо в браузере и на телефонах, используя лишь 2 гигабайта оперативной памяти. На генерацию изображения 512x512 на iPhone 17 Pro Max с такой моделью уходит 9.4 секунды при 4 шагах, что неплохо, если учитывать факт офлоадинга. Мы ожидаем появления более крупных моделей для локального деплоймента.

