Liquid AI представила крупную и энергоэффективную модель LFM2-24B-A2B.
Компания Liquid AI представила свою крупнейшую модель — LFM2-24B-A2B.
Ключевые характеристики модели:
- Общее число параметров — 24 миллиарда.
- На каждый токен активно только 2,3 миллиарда параметров.
- Модель построена на гибридной, аппаратно-оптимизированной архитектуре LFM2.
LFM2-24B-A2B сочетает быстрый и экономичный дизайн LFM2 с архитектурой Mixture of Experts (MoE), благодаря чему при работе задействуется лишь небольшая часть параметров. Это обеспечивает:
- Высокую энергоэффективность.
- Быструю работу на edge-устройствах.
- Предсказуемый лог-линейный рост качества.
- Возможность полного запуска в пределах 32 ГБ памяти.
С выходом этой версии линейка LFM2 теперь охватывает почти два порядка масштаба — от 350 миллионов до 24 миллиардов параметров. При этом каждое увеличение размера даёт стабильный рост качества на стандартных бенчмарках.
Модель специально оптимизирована так, чтобы помещаться в 32 ГБ RAM, что позволяет запускать её на потребительских ноутбуках и рабочих станциях.
Стратегия масштабирования
- Увеличение глубины сети с 24 до 40 слоёв.
- Увеличение числа экспертов с 32 до 64 в каждом MoE-блоке.
- Сохранение компактного активного пути вычислений.
Итог: общее число параметров выросло в 3 раза, но вычислительная нагрузка осталась контролируемой.
LFM2-24B-A2B выпущена как instruct-модель и показывает лог-линейный рост качества на задачах: GPQA Diamond, MMLU-Pro, IFEval, IFBench, GSM8K, MATH-500.
Модель получила поддержку «с первого дня» в:
- llama.cpp
- vLLM
- SGLang
Доступны квантованные версии (GGUF), работающие на CPU и GPU. Например:
- На CPU (Ryzen AI, Q4_K_M) — около 93 токенов в секунду при контексте 8K.
- Высокий throughput и на GPU (H100).
Главный вывод: архитектура LFM2 демонстрирует предсказуемое масштабирование без «потолка качества» у малых моделей.
Модель доступна на Hugging Face.

