Инженер Google объяснил, как дообучить крошечную LLM прямо на телефоне и повысить точность с 46% до 90%.
Инженер Google объяснил, как дообучить крошечную LLM прямо на телефоне
Инженер Google Кормак Брик поделился методом, который позволяет взять небольшую языковую модель Gemma 270M, дообучить её на обычном смартфоне и поднять точность с 46% до 90% в своей задаче. При этом всё работает полностью офлайн и с высокой скоростью.
Пошаговая схема выглядит так:
- Выбрать модель Gemma 270M.
- Сгенерировать синтетические данные под задачу.
- Дообучить модель методом LoRA.
- Квантизировать её до формата int4.
- Развернуть на устройстве Pixel и получить скорость до 2000 токенов в секунду.
Именно такой пайплайн позволяет модели с 270 миллионами параметров превзойти модель с 70 миллиардами параметров в конкретной задаче и при этом работать офлайн прямо на вашем смартфоне.
Подробнее в видео: смотреть на YouTube

