Как прокачать GigaChat: внешняя база знаний, Qwen, DeepSeek и Structured Output.
Российские модели уровня GigaChat и YandexGPT поддаются универсальным техникам прокачки слабых GPT, хотя у них есть особенности. Ещё год назад GigaChat или YandexGPT могли решать задачи resource leveling, которые штатно считались для них «космическими».
Почему GigaChat отстает в планировании
Особенность GigaChat состоит в слабом наборе данных для pretraining по «планам». Обычно топовые вендоры LLM генерируют миллионы планов агентов и добавляют их в base-модель и на этапе SFT. Технически модель легко этому обучается, что решает проблему «отсутствия мозгов», в том числе у SLM. Проблема GigaChat в том, что планированию как агент он обучен хуже современных SLM с объёмом около 27B параметров. Однако это можно исправить, и часто без больших сложностей.
Внешняя база знаний как внешний CoT
Нужно сгенерировать в нормальной фронтирной LLM целую базу знаний (Knowledge Base) по планам разных типов и загружать её под задачу. Это почти «внешний CoT». Лучше брать не Claude и не Grok, хотя они тоже работают, а китайские модели, из которых GigaChat дистиллируют: Qwen и DeepSeek. Благодаря родству через дистилляцию их промпты заходят в GigaChat лучше.
Интересный момент: с GigaChat часто срабатывает обычный step-by-step промпт от фронтирной модели даже без few shots. Иными словами, модель не такая слабая, как может показаться, но она плохо обучена планированию действий как агент, поэтому план нужно «подкладывать».
Structured Output для слабых моделей
Если GigaChat сбивается при выполнении многошагового плана по базе знаний, стоит применять Structured Output. Мы просим оформить шаги плана и наполнение инструментов через JSON. Structured Output жёстко загоняет LLM в заданную схему через фильтрацию логитов. Полученный JSON уже можно алгоритмически разбирать и выполнять. Код для этого можно написать в том же DeepSeek.

