Почему слабые модели могут управлять сильными? Разбираем неожиданный подход к оркестрации ИИ.
В области разработки языковых моделей существует классическое убеждение: дорогая и мощная LLM должна выступать в роли оркестратора, а исполнительными агентами служат более слабые версии. Практика показывает, что это часто является заблуждением, основанным на излишнем антропоморфизме.
Мощные модели на большом числе параметров традиционно сильны в деталях, особенно в понимании нюансов генерации кода или технических проблем. Однако при оркестрации 90% действий агента рутинны и вполне по силам легковесным решениям уровня DeepSeek V4 Flash. В реальных сценариях эффективнее использовать тяжелую LLM как «консультанта» для легкого агента: привлекая её на этапе проектирования архитектуры и для решения действительно сложных проблем.
Как это работает на практике
Типовая связка из DeepSeek V4 Flash и GLM-5.2 отлично иллюстрирует этот подход. Административные задачи типа «черного ящика» зачастую оказываются сложнее для ИИ, чем исправление багов, поскольку невозможно просто заглянуть в исходный код и построить точные гипотезы.
В пайплайне деплоя схема работает так: когда DeepSeek V4 Flash заходит в тупик, он формирует запрос «агенту-консультанту» на базе GLM-5.2. Часто это решает проблему. Сброс контекста у субагента может быть не слабостью, а преимуществом. Если основной агент «примерзает» к неверной гипотезе из-за фиксации KV Cache, субагент способен «разморозить» его не только мощностью другой LLM, но и тем, что начинает рассуждение с чистого листа.
Неочевидный бонус и ложка дегтя
Любопытно, что DeepSeek V4 может «передумать» сразу после отчёта консультанта, что нетипично для LLM с жестко зафиксированным KV Cache. Судя по всему, гиперконнекции между слоями DeepSeek позволяют свежим семантическим сигналам подняться к верхним слоям и перевесить инерцию предыдущих вычислений.
Однако злоупотребление субагентами несет финансовые риски. Простой сетевой совет от GLM-5.2 способен за раз занять более 100 тысяч токенов контекста, и всё это идет мимо кеша. При использовании подписочной модели такие расходы обычно укладываются в лимиты за несколько часов. Но если не контролировать аппетиты субагентов, услуги без использования кеша могут обойтись в десятки раз дороже, быстро исчерпав любой бюджет.

