Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Какую нейросеть запустить локально: от 8 до 512 ГБ памяти.

Мы собрали варианты локального запуска нейросетей для программирования, работы с изображениями и агентных задач. Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.

8 ГБ

  • Spark-X2.5-4B. Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.
  • Ternary Bonsai 27B. Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.

16 ГБ

  • Gemma 4 12B. Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.

24 ГБ

  • Qwen3.8-27B. Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.

32–64 ГБ

  • Nex-N2.5-mini. Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.

96–128 ГБ

  • Qwen3.8-Flash-Next. Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.
  • GLM-5.3-Flash EXL3 2.0bpw. Экспериментальная сборка, проверенная на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.

192–256 ГБ

  • DeepSeek-V4-Flash-Vision-Exp. Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.
  • Nex-N2.5-Pro. Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.
  • GLM-5.3-500B EXL3 3bpw. Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.
  • GLM-5.3-Flash EXL3 Q4. Экспериментальная сборка: полноценный запуск сервера для неё ещё не проверен.

384–512 ГБ

  • GLM-5.3. Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.

Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.

Этот пост Вконтакте:

Ещё новости:

Apple Watch Series 12: первый ИИ-чип, мониторинг здоровья и цена $399.
Грег Брокман и Дженсен Хуанг засвидетельствовали явление AGI в лице GPT-6 Astra!
Узкая экспертиза в ИТ и ИБ больше не работает: какие навыки теперь ищет бигтех.
Higgsfield AI показала дрон-шоу, написанное GPT-6 Astra без единой строчки человеческого кода.
GPT-6 Astra обошла Claude Fable 5.1 в Vending-Bench 2 и осталась честной.
Яндекс запустил ИИ-персонажа Льва Толстого в чате с Алисой AI.
AI Players: мод для Minecraft добавит ИИ-игроков с характером и планами.
ИИ заменяет артистов: фейковая песня Эминема завирусилась на YouTube.
GPT-6 бесплатно на целые сутки: Arena открыла доступ к топовой нейросети!
ИИ-агенты OpenAI уже выполняют 3,1 дня работы на каждый человеческий день.