Microsoft с помощью SkillOpt увеличила точность ChatGPT с 41% до 80% без изменения модели.
Обычно все думают, что AI-агенты становятся лучше через промпты или fine-tuning. Но fine-tuning дорогой, медленный и жёсткий. А «prompt engineering» часто превращается в угадайку.
Подход Microsoft другой: они оптимизируют не модель, а skill-документ. То есть текстовую инструкцию, которая объясняет агенту, как решать задачу. SkillOpt делает этот документ живым: он учится на ошибках агента.
Как это работает
- Агент выполняет задачи и собирает успешные и провальные попытки.
- Отдельная маленькая модель анализирует результаты и точечно меняет skill-документ: добавить, удалить или заменить фрагмент.
- Новая версия принимается только если реально улучшает результат на отдельном наборе задач.
По сути, это что-то вроде градиентного спуска для естественного языка. Результаты сильные: на шести крупных бенчмарках SkillOpt обошёл и человеческие skills, и одноразовые LLM-подходы. На ALFWorld одна модель выросла с 70% до 85% точности. В чат-сценариях прирост был больше 23 пунктов.
Главный плюс: нет лишней нагрузки во время инференса. Один раз тратится compute на оптимизацию skill-документа, а потом агент работает с уже улучшенной инструкцией. Идея мощная: агент становится лучше не потому, что переписывается код или дообучается модель. А потому что его «плейбук» сам улучшается через обратную связь.

