Какую нейросеть запустить локально: от 8 до 512 ГБ памяти.
Мы собрали варианты локального запуска нейросетей для программирования, работы с изображениями и агентных задач. Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.
8 ГБ
- Spark-X2.5-4B. Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.
- Ternary Bonsai 27B. Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.
16 ГБ
- Gemma 4 12B. Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.
24 ГБ
- Qwen3.8-27B. Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.
32–64 ГБ
- Nex-N2.5-mini. Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.
96–128 ГБ
- Qwen3.8-Flash-Next. Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.
- GLM-5.3-Flash EXL3 2.0bpw. Экспериментальная сборка, проверенная на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.
192–256 ГБ
- DeepSeek-V4-Flash-Vision-Exp. Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.
- Nex-N2.5-Pro. Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.
- GLM-5.3-500B EXL3 3bpw. Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.
- GLM-5.3-Flash EXL3 Q4. Экспериментальная сборка: полноценный запуск сервера для неё ещё не проверен.
384–512 ГБ
- GLM-5.3. Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.
Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.

