Open-source навык Local Inference Optimizer поможет агенту настроить локальный запуск моделей.
Мы рады представить open-source навык для агентов Local Inference Optimizer.
Идея простая: вместо того чтобы спрашивать у агента «как запустить модель локально?» и получать общую инструкцию на несколько экранов, можно дать ему навык, который заставит его действовать целенаправленно:
- Сначала определить железо: Mac / NVIDIA / AMD / Intel / CPU-only.
- Выбрать подходящий движок для инференса (inference engine).
- Настроить проект через
uvи.venv. - Подобрать ядра и квантизацию (kernels / quantization).
- Подкрутить batching, KV cache, context, prefix cache, tensor parallel.
- Запустить сервер.
- Проверить health check и OpenAI-совместимый smoke test.
Навык помогает агенту выбирать между несколькими популярными инструментами:
- MLX, если Mac / Apple Silicon.
- llama.cpp, если GGUF, edge, нестандартное железо или нужно «чтобы просто работало».
- ExLlamaV2/V3, если потребительская NVIDIA и хочется максимальной локальной скорости.
- vLLM, если нужен нормальный OpenAI-совместимый API для продакшена.
- SGLang, если длинный контекст, MoE, структурированный вывод, сложная маршрутизация.
- TensorRT-LLM, если дата-центр NVIDIA и нужна предельная производительность.
Быстрая установка в Hermes:
curl -fsSL https://raw.githubusercontent.com/ForgetMeAI/local-inference-optimizer-skill/main/install.sh | bash
Затем активация:
hermes -s local-inference-optimizer
И пример запроса:
Определи лучший inference engine под моё железо, настрой проект через uv + venv, подбери kernels/quantization, подкрути flags, batching, KV cache и оптимизируй запуск под мою модель.
Используйте, форкайте, улучшайте: https://github.com/ForgetMeAI/local-inference-optimizer-skill

