AI VK Research: как рекомендации учатся думать о всей сессии, а не о следующем лайке.
Мы обратили внимание на подход AI VK Research: исследователи учат рекомендательные системы думать не о следующем лайке, а обо всей сессии. В классических рекомендациях модель обычно оптимизирует ближайший сигнал: клик, лайк или дослушивание. Однако каждое действие меняет состояние пользователя, и хорошая рекомендация сейчас может привести к плохому продолжению сессии, и наоборот.
AI VK Research формулируют рекомендации как задачу Reinforcement Learning: пользователь выступает средой, модель агентом, рекомендация действием, а реакции пользователя становятся наградой. Главная сложность в том, что обучение проходит на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учитывать разницу между старой и новой политикой и избегать взрыва дисперсии.
В экспериментах такой подход улучшил оценку долгосрочной сессионной награды без существенной потери стандартных метрик рекомендаций.
Источник: Хабр, AI VK Research

