DeepSeek V4 Flash теперь можно запустить локально на одном Mac.
На Hugging Face появилась специальная GGUF-сборка DeepSeek-V4-Flash-0731 для компьютеров Apple Silicon со 128 ГБ объединённой памяти.
Официальная модель содержит 304 млрд параметров и поддерживает контекст до 1 млн токенов. После смешанной 2- и 4-битной квантизации файл занимает 97,6 ГБ.
Чувствительные слои, attention и общие эксперты сохранены в повышенной точности, а основная часть MoE-экспертов сжата агрессивнее.
Для запуска используется специализированный движок ds4 (DwarfStar):
git clone https://github.com/antirez/ds4 cd ds4 make ./ds4 -m gguf/DeepSeek-V4-Flash-0731-....gguf \ -p "Напиши распределённый кеш на Go"
Это нестандартный GGUF. Он не загрузится в Ollama, LM Studio или llama.cpp из-за особой структуры тензоров и схемы квантизации.
Модель уровня крупного серверного кластера удалось целиком уместить в память одного мощного Mac. Медленно и требовательно к железу, зато полностью локально.
Модель: https://huggingface.co/ox-ox/DeepSeek-V4-Flash-0731-gguf-ds4

