Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Microsoft с помощью SkillOpt увеличила точность ChatGPT с 41% до 80% без изменения модели.

Обычно все думают, что AI-агенты становятся лучше через промпты или fine-tuning. Но fine-tuning дорогой, медленный и жёсткий. А «prompt engineering» часто превращается в угадайку.

Подход Microsoft другой: они оптимизируют не модель, а skill-документ. То есть текстовую инструкцию, которая объясняет агенту, как решать задачу. SkillOpt делает этот документ живым: он учится на ошибках агента.

Как это работает

  1. Агент выполняет задачи и собирает успешные и провальные попытки.
  2. Отдельная маленькая модель анализирует результаты и точечно меняет skill-документ: добавить, удалить или заменить фрагмент.
  3. Новая версия принимается только если реально улучшает результат на отдельном наборе задач.

По сути, это что-то вроде градиентного спуска для естественного языка. Результаты сильные: на шести крупных бенчмарках SkillOpt обошёл и человеческие skills, и одноразовые LLM-подходы. На ALFWorld одна модель выросла с 70% до 85% точности. В чат-сценариях прирост был больше 23 пунктов.

Главный плюс: нет лишней нагрузки во время инференса. Один раз тратится compute на оптимизацию skill-документа, а потом агент работает с уже улучшенной инструкцией. Идея мощная: агент становится лучше не потому, что переписывается код или дообучается модель. А потому что его «плейбук» сам улучшается через обратную связь.

arxiv.org/pdf/2605.23904

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.