DeepSeek V4 Flash на двух DGX Spark с DSpark: 96 токенов/с всего за $10 000.
Инженер запустил оригинальную версию DeepSeek V4 Flash на двух устройствах DGX Spark с технологией DSpark. Стоимость оборудования составила около $10 000, что крайне мало для инференса передовой LLM. При использовании DSpark скорость выросла с 60 до 96 токенов в секунду, то есть на 60%. Без ускорителя запустить такую модель на этом железе было бы проблематично.
Однако прирост производительности зависит от нагрузки: при большем числе одновременных соединений выигрыш снижается до 20%. DSpark использует аппаратный планировщик для задействования простаивающих GPU. Тем не менее сам факт, что за $10 000 можно развернуть мощную LLM и обслуживать четырёх пользователей с приемлемой скоростью, выглядит отличной экономикой.
Подробные результаты тестов и код выложены на GitHub: MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark.

